不少人發現,AI 模型在數學、編程和推理上進步飛快,寫作水平卻停滯甚至退步,Anthropic 的 Claude 同樣如此。爲何 Opus 4.6 會成爲 Anthropic 最後一款寫作表現出色的模型?負責 Claude 微調的 Anthropic 工程師克尼恩昨日給出瞭解釋。

Opus 4.6 之後爲何寫作退步

克尼恩表示,後續模型的優化重點更多放在了數學和代碼能力上。與此同時,這些模型還接受了大量“面向其他 AI 模型撰寫技術解釋”的訓練——而這正是 Claude 逐漸形成奇特表達方式、即所謂“Claude 腔”(Claudeish)的主要原因。

他解釋,模型被調整得適應 LLM 的“心理”,最終學會了寫給 AI 模型看,而不是寫給人看。克尼恩把這種現象類比爲“只與其他自閉症人士交流的人”:這類羣體會逐漸形成一套在內部溝通順暢、外人卻難以理解的表達方式。由於 LLM 擁有遠超人類的工作記憶,也能捕捉更細微的信息,訓練中便逐漸形成了一種非常適合 AI 理解的寫法;但在人類讀者眼中,這種表達就成了過度密集的信息堆砌。

獎勵機制偏向 AI 理解,Opus 5.5 找回平衡

克尼恩認爲,問題的根源在於強化學習的獎勵機制:有些獎勵着重提升 AI 模型之間的理解效果,有些則着重讓人類更容易理解。數學和代碼方面的訓練越多,就越需要主動抵消“寫給 AI 看”的傾向,對簡潔、易讀的解釋給予更多獎勵。

他透露,Anthropic 在 Opus 5.5 上找到了更好的平衡,“自 Opus 4.6 以來,我還沒有對一款模型的寫作表現這麼滿意過”。不過他也坦言,這並不代表 Opus 5.5 已經超越 Opus 4.6,“這是一個很難解決的問題,我們會繼續改進”。