「開了 MTP 會不會降質?」、「量化版本點揀?」、「思考強度係咪無腦開到最高?」

這不是紙上談兵的模型比較,而是一場真實的小模型淘汰賽。UP 主 karminski-牙医 把模型放進前端、Python 和 Agent 任務,看看它們究竟能不能真的做事——不只是生成一段看起來很完整的答案。

先講結論:模型最強,不等於最適合你

這場測試最值得看的,不是最後誰拿到「源神」稱號,而是模型在實際任務中會不會成功、穩定、可重現,而且成本合理。有些模型答案很漂亮,但程式跑不起來;有些模型偶爾能做出驚艷結果,卻未必每次都可靠。

51 個配置,究竟在比什麼?

影片合共測試 51 個模型配置,涵蓋 8 個模型系列:

  • Qwen3.8-27B
  • Qwen3.6-27B
  • Qwen3.6-35B-A3B
  • Ornith-1.5-35B-A3B
  • Gemma-4-31B
  • Gemma-4-26B-A4B
  • Gemma-4-12B
  • GPT-OSS-20B

每個模型再比較 4 種量化版本、MTP 開啟或關閉,以及 low、medium、xhigh 三種思考強度。測試集中在前端、Python 編程和 Agent 能力,每個任務執行 3 次,以 pass@3 觀察模型的最佳表現。

第一關:寫得出來,還要跑得起來

前端測試不是叫模型寫幾行簡單 HTML,而是讓它處理 JavaScript、3D 建模和粒子模擬。這種任務很容易暴露模型的真實水平:程式碼表面上完整,不代表實際畫面可以正常運作。

影片展示的差距相當直接:

  • GPT-OSS-20B:示範中沒有成功運行的結果,還出現重複輸出。
  • Gemma-4-12B:建模效果較弱,測試失敗率亦較高。
  • Gemma-4-26B-A4B:畫面相對穩定,顏色一致性較好。

這裡的重點不是替所有模型排一個永遠不變的名次,而是提醒我們:可運行率和穩定性,往往比一次驚艷的 demo 更重要。

量化、MTP、思考強度:沒有真正的「無腦最佳設定」

高思考強度未必適合所有任務。複雜 Agent 工作可能需要更多推理,但簡單編程任務開到最高,可能只是增加等待時間和成本。量化版本也是一樣:省下顯存和速度,可能換來部分品質或穩定性差異。

  • 量化:要一起看顯存、速度、品質和成功率,不能只看模型名稱。
  • MTP:可能提高生成速度,但要用相同任務多次比較是否影響穩定性。
  • 思考強度:應該按任務選擇,而不是每次都直接拉到最高。

這場測試花了幾多?

測試使用 H100 來縮短生成時間,但仍然跑了約 48 小時,總成本約 148 美元。H100 主要影響測試速度,不會自動令模型的生成能力變強;換到自己的顯卡、量化版本和推理框架,結果仍可能不同。

對本地 AI 玩家最實用的 4 個提醒

  1. 不要直接照抄別人的冠軍設定:先用自己的工作負載重跑。
  2. 不要只記錄「答對沒有」:同時記錄能否運行、延遲、顯存、穩定性和電費。
  3. 不要把 pass@3 當成日常成功率:它比較像模型的能力上限,未必代表每次都做到。
  4. 按用途分開測:前端、Python 和 Agent 是不同能力,沒有一個排名可以完全代表所有場景。

所以,誰才是「源神」?

答案可能不是一個固定的模型,而是一個適合你工作流程的組合:在你的硬件上跑得動、速度可以接受、成本負擔得起,而且重跑時仍然可靠。

這場測試真正有價值的地方,是把「哪個模型最強」改成了更實際的問題:哪個模型在我的任務上,能穩定地把事情做完?

來源與轉錄說明

內容審閱級別:content-reviewed。原片沒有官方字幕,本篇使用本機 faster-whisper small、CPU int8 轉錄公開音訊,再配合影片頁面公開描述校正模型名稱。原始 ASR 有少量術語誤識別,因此本文採用主題式整理,只保留可互相印證的重點,沒有直接貼出逐段原始轉錄。

原片:Bilibili|谁是源神? 51个小模型全面评测!