DeepSeek和智譜接連更新模型,但都沒能炸場
沒有一家模型廠商最近能夠放松警惕。前后大概不到48小時,DeepSeek和智譜相繼更新了自己的模型進展。
【資料圖】
先是DeepSeek于8月12日晚將API文檔更新為DeepSeek-V4-Pro正式版,又于13日對官宣內容進行了回撤和重新發布,但調整期間保留API服務;再是8月14日,智譜GLM-5.3正式發布。
拋開DeepSeek回撤事件本身可能存在的問題暫且不談(當時大量評測稱第三方測試結果與官方聲明不符,甚至反饋不如同模型的Flash版本),官方公告顯示,正式版DeepSeek V4 Pro是一款針對Agent(智能體)能力進行增強的模型,尤其在生產環境任務中表現出更為明顯的性能提升。
在Agent相關評測集中,其總體成績與Kimi K3、Opus 4.8和Fable 5在同一水平線上。
智譜GLM-5.3則繼續強調編程能力。該模型與前代GLM-5.2使用完全相同的基座模型,主要通過后訓練提升性能,利用強化學習(基于IndexShare、SAO以及新一代Slime框架)擴展了長程任務環境和訓練時長。
從評測集表現來看,GLM-5.3的部分能力接近Fable 5和GPT-5.6 Sol,并在展示出來的多個榜單中成績超過了Kimi K3,但在聚焦長程軟件工程與持續代碼修改能力的DeepSWE v1.1上仍然不及K3。
安全是GLM-5.3強調的另一個特性,此前Anthropic的Mythos 5曾引起模型安全性能的話題熱度。
據其介紹,在CyberGym測試中,模型從白盒源代碼出發,通過觸發程序故障來識別和驗證漏洞,GLM-5.3得分為84.5%,略高于Mythos 5的83.8%和GPT-5.6 Sol的83.6%;在更考驗深度推理能力的ExploitBench中,GLM-5.3得分為54.4%,低于Mythos 5的78.0%和GPT-5.6 Sol的76.5%。
在用戶層面,或是由于DeepSeek-V4-Pro正式版受到初期問題的影響,多名完成測試的受訪者對界面新聞記者表示,在編程任務上,GLM-5.3的體驗比DeepSeek-V4-Pro正式版更好。
不過,其中一名開發者明確表示,這兩者可能都不會作為工作流主力,“國產模型里面,目前還是只有K3在第一梯隊。”他說,這不僅體現在能力提升全面上,在性價比層面也有意義。
這個結論的一個重要背景是DeepSeek對其API定價策略進行了調整。
其API將首次采用峰谷定價模式,其中閑時段的使用價格將降至高峰時段的一半。但從DeepSeek V4 Pro高峰期價格來看,其緩存命中輸入和緩存未命中輸入單價分別同比增長1100%及200%,輸出價格同比增長350%。
細致到K3與DeepSeek-V4-Pro正式版之間,漲價前,前者緩存命中輸入價格為后者約一千倍,目前則是十倍左右,緩存未命中輸入價格則從6倍有余減少到約2倍(高峰期),輸出價格也從過去的16倍左右降低到現在的約4倍。
曾經一度懸殊的性價比表現,如今再將任務的對話輪次、完成質量、整體時長考慮其中,不同訴求的開發者再作抉擇時答案可能會發生變化。
事實上,無論是DeepSeek-V4-Pro正式版還是GLM-5.3,都是在上一代基座模型基礎上進行后訓練迭代,Kimi K3實現性能突破則源于對基座模型再度擴大規模訓練。這兩種選擇說明了什么問題?
一名AI領域投資人表示,從模型技術層面來說,這至少說明兩點,預訓練Scale Up仍然有用、現有規模后訓練也有極大提升空間——在這一點上,更好的證據是1.5T的Grok 4.6,幾乎達到了GPT-5.6、Opus 5的同等水平。
對國產模型廠商而言,這意味著代際層面的性能跨越,或許仍然繞不開基座模型的Scale Up,而與此同時,在它們實現這一點之前,Kimi K3的潛能顯然也還沒有充分挖掘。

精彩看點:二套標準如何理解買房決策需重視?