0% 成功率,零例外——一個乾淨到不能信的分數
在 ARM64 AI 工作站上跑一套 AI agent 評測,好幾週「這個模型就是不夠好」的數字,其實根本什麼都沒測到——負責評分的腳本自己一直在悄悄地當掉,連真正成功的那些嘗試也被算成失敗。
This article is also available in English: English version——內容相同,僅語言不同。
在一台 ARM64 AI 工作站上,針對一個本地模型跑一套標準的 agent 程式碼評測, 通過率停在一個可疑到不能再可疑的整數 0%,而且維持得比感覺上合理的時間還久很多。 零例外、沒有部分給分,摘要輸出裡也看不到任何像是錯誤的東西—— 就只是一個乾淨、一致的全面失敗,讀起來完全就像是「這個模型還不夠好」。 但事實不是這樣。真正壞掉的是評測本身的計分機制, 而且從第一個數字被相信的那一刻起,它就已經壞了。
第一個錯誤方向:先假設是硬體的問題
整套架構是:一套標準的 agent 程式碼評測套件,建立在 x86_64 的 Docker 映像檔上, 拿來對一個跑在 ARM64 AI 工作站上的本地模型做評測——代表每個評測用的容器, 都是透過 CPU 模擬跑的,不是原生執行。一開始測試結果陸續回來,速度慢又失敗時, 第一個直覺是懷疑硬體本身撐不住這個工作,並且開始評估要不要買第二台規格更好的機器。 但簡單看一下實際的負載平均值(只用到可用核心裡很小一部分)跟 GPU 使用率(閒置), 馬上就排除了這個可能——這根本不是容量問題,砸更多硬體下去也不會解決任何事。
Unlock this article to keep reading, or subscribe for unlimited access to everything. See Pricing for details.