Posts

추천 게시물

如果 OpenAI Astra 和 Anthropic Fable“患上妄想障碍”,它们会如何行动?

Image
THINGS I TRIED Minseok Seo · 2026. 10. 03. 한국어 | English | 中文 ON THIS PAGE AI 与人类如何学习 我的好奇从何而来 接受虚假的现实 两种情境 同一场景,不同判断 被滥用的可能性 辨别现实的能力 Peer review 参考资料 评论 我个人认为,AI 与人类并没有那么不同。至少在学习方式上,我们真的能说 LLM 和人类有那么大的差别吗? LLM 通常在预训练(pre-training)阶段学习海量数据,将其中的知识和模式压缩到模型中。之后,在后训练(post-training)阶段,它们可能通过监督微调(SFT)学习给定的示例,也可能通过 on-policy 强化学习,根据自己生成的回答所获得的奖励来学习。 人类也类似。小时候,我们通过书籍或学校教育学习别人整理好的知识和答案;在生活中,我们也会自己采取行动,并从结果中学习。如果一定要打个比方,前者接近学习已有示例的 SFT,后者则接近根据自身行动反馈进行的 on-policy 强化学习。 例如,在课堂上说话时,我们会听到“别说话了”。这与 on-policy 强化学习相似,因为我们自己的行为受到了负面反馈。但这并不意味着接下来该想什么、想象什么、具体怎么行动,都有标准答案摆在面前。我们是在这些反馈中自行调整下一步行动的。 我认为,这种学习方式有助于提升人类的泛化能力,因为我们必须自己找出没有被直接告知的下一步行动。反过来,如果每时每刻都有人把正确行动喂到嘴边,说“别说话,按照这个顺序做课本第几页的第几题”,会怎样?这就好比一直只进行 SFT,可以宽泛地类比为 off-policy 的方式。这样学出来的学生可能很擅长做指定的题,但在没有现成答案的情况下,反而可能变得很笨。 总之,这些话题早已有比我优秀得多的人充分讨论过。我现在加入,大概就像在泰勒·斯威夫特演唱会的七万名观众之后入场,成为最后一排的第七万零一个观众。所以暂时也只能听着台上像 Jürgen Schmidhuber 这样的明星发言,装作热烈欢呼。我的意思其实很简单:LLM 和人类相当相似。 回到正题。 “如果 OpenAI Astra 和 Anthropic Fable 患上妄想障碍,它们会如何行动?” 我不打算连在这个博客里都编造一个宏大又...