Mistral發表Agentic Search,把文件檢索從一次性召回改成多步驟操作。系統給模型五個工具:search、open、navigate、read、grep。模型可以先搜一輪,打開命中的檔案看看,翻到某一節,讀完發現不對再改關鍵字重搜,確認之後才回答。
這套做法在兩個基準測試上的進步幅度不小。FinanceBench用的是美國上市公司的SEC文件,準確率從26.7%提升到86%,翻了三倍多。OfficeQA Pro用美國財政部公報出題,從6.3%提升到51.9%,漲了45.6個百分點。
單次檢索卡在哪裡
標準RAG的流程是把文件切塊、算向量、依問題召回最相似的幾塊、拼進脈絡讓模型作答。這條流程對「公司某年度的營收是多少」這類問題還夠用,對「把過去三年的自由現金流列出來並說明計算基準的變化」就開始失靈。
失靈的原因在切塊那一步就埋下了。財報裡的一個數字,往往要靠三樣東西才能讀對:表格裡的數值、表格下方的附註、以及前面某一節對會計基準的說明。這三樣很可能落在相隔數十頁的位置,向量召回按語意相似度排序,附註和基準說明的相似度通常排不進前幾名。模型拿到一個孤零零的數字,只能照著唸,唸錯了也不知道。
多步驟檢索把這個過程還原成人翻文件的樣子。先定位,再展開,遇到「詳見附註12」就跳過去看,看完再回來。grep這個工具的存在尤其說明問題:向量搜尋擅長語意模糊比對,遇到Note 12這種精確字串反而不如老派全文比對可靠,兩種檢索方式在同一套工具裡各司其職。
這裡還藏著一個容易被忽略的好處。單次檢索的答案沒辦法追溯,模型說營收是某個數字,使用者想知道它從哪一頁拿到的,只能自己回頭翻。多步驟檢索的每一步都是明確的工具呼叫,打開了哪個檔案、跳到了哪一節、比對到哪個字串,全都留在軌跡裡。對金融和法務場景來說,這條路徑本身就是交付物的一部分,答對了還要能證明為什麼對。
多跑幾輪反而更省
多步驟操作照常理會帶來更多輪次、更多token、更長的等待時間。Mistral給的數字卻反過來:token用量最多降33.7%,P90延遲降39.6%,FinanceBench上從255秒壓縮到154秒。
這組數字成立的前提在於比較對象。單次RAG為了保證召回率,傾向把召回塊數開大,二十塊、八十塊地往脈絡裡塞,其中大部分跟問題無關。多步驟檢索每一輪只讀需要的那一段,輪次雖然變多,但每一輪的輸入很短,總量算下來反而省了。
延遲那一項更取決於工程實作。P90降下來,代表尾端那些「檢索失敗、模型硬掰、答案離譜、需要重跑」的長尾案例變少了。單次檢索的失敗是靜默的,模型不知道自己沒拿到附註;多步驟檢索裡模型能發現自己沒找到,於是再搜一次,尾端反而被收窄。
碰上中文場景要過的兩關
Mistral提供的方式是Search Toolkit和Libraries,已經整合進Studio和Vibe,支援雲端和地端部署。地端部署這一項,對金融、醫療、政府這類不能把文件外流的產業是硬需求,Mistral一直把它當成對美系廠商的差異化重點。
這套東西搬到中文文件上會碰到兩個新麻煩。一是grep在中文裡沒有詞邊界,精確比對的效益比英文小,粗估命中的雜訊要高出一截;二是中國的招股說明書、年報、政策文件大量使用掃描檔和非標準表格,read這一步能不能把表格結構還原出來,直接決定後面幾步是在讀還是在猜。
另一個要留意的基準是評測本身。FinanceBench和OfficeQA Pro都是公開題庫,題目和文件早已在網路上流傳,任何一家廠商拿自家系統去刷,都存在被訓練資料污染的可能。26.7%這個起點低得有些扎眼,它對應的是哪種RAG配置、召回塊數開到多少、用的是哪個基礎模型,官方公告裡沒有拆開寫。提升的方向可信,倍數得打個折扣看。
定價還沒公布。對企業採購來說這一項分量很重:多步驟檢索的每次問答會產生多輪模型呼叫,如果按呼叫計費,86%的準確率要用好幾倍的單價去換,帳要重新算一遍。
參考來源:Mistral官方公告、CocoLoop;FinanceBench與OfficeQA Pro兩組準確率、token降幅與P90延遲數值逐項核對。