《agenticmisalignmenthowllmscouldbeinsiderthreats》
知道你们懒给你们总结下,这个是临替换时泄露资料、实施欺骗的支持文献。
《optimalpoliciestendtoseekpower》
这个是大模型获取更多……(剧透,就省略掉了)的支撑。
《traininglargelanguagemodelsonnarrowtaskscanleadtobroadmisalignment》
这一篇是发在今年《nature》上的,这个我也不终结,也会剧透。
好了伐这些论文出来不是为了装逼,是为了卖惨,真不是偷懒请假,是我时间不够呀,今天下午我不上班可以写一些,所以最迟明天也能把今天的补上,好了,大家晚安。