近日,OpenAI 公佈了 719 份由其模型生成的數學問題解答,涉及多項開放研究問題。儘管該公司表示在發布前曾諮詢數學與人工智能顧問小組,但根據公開情況看,其流程尚未完全達到該小組提出的標準,特別是在對人類理解、形式化驗證和同行審查的充分保障上存在缺失。OpenAI 的該顧問小組由普林斯頓高等研究院牽頭,成員包括來自全球多家機構的 9 名數學研究人員。該小組此前建議,停止使用專有模型測試高等數學問題,但 OpenAI 此次明確使用專有模型評估開放數學問題。
OpenAI 的數學問題解答存在多項不足之處
在 719 份文稿中,只有 10 份披露了模型得出結論的推理過程,另有 42%的證明未完成形式化處理。一項由劍橋大學和倫敦國王學院數學研究人員完成的新論文指出,OpenAI 針對一個由納維-斯托克斯方程衍生的問題給出的解答中,自然語言證明與形式化代碼之間至少存在兩處差異。這些差異不一定意味著證明錯誤,但顯示模型在將文字推理轉換為可驗證代碼時可能發生誤譯。
顧問小組此前要求實驗室提供機器可讀的關聯資訊,以對應自然語言證明和形式化結果,但 OpenAI 此次並未提供。數學家認為,機器生成的證明仍需接受與傳統證明相同的同行審查。陶哲軒也指出,如果提示模型解題的人無法解釋結果、參與報告或回應同行問題,相關成果便難以真正融入數學研究。哈佛大學數學教授梅拉妮·伍德表示,模型輸出解答時,人類理解往往尚未形成,後續驗證工作才剛剛開始。

