香港, 2026年9月8日 - (亞太商訊) - 當Coding Agent 從代碼補全、函數生成和局部 Bug 修復,逐步走向真實代碼庫中的問題定位、跨文件修改和自主測試,行業對評測基準也提出了新的要求:模型能否理解一個完整任務,識別跨模組依賴,在長鏈路執行中修正錯誤,並最終交付可以通過測試的工程結果?
圍繞這一問題,上海本原智數科技有限公司(以下簡稱「本原智數」)與 SWE-Bench ProMax 團隊展開合作,共同推動這一面向大規模、多語言代碼重構的 Benchmark 在模型研發、Agent 評測和軟件工程研究中的應用與持續建設。
SWE-Bench ProMax 已被 COLM 2026 接收。當前 v1 包含 170 個來自真實 GitHub 項目的軟件工程任務,覆蓋 C、C++、Go、Java、Python、Rust 和 TypeScript 七種編程語言。每個任務平均涉及 11.4 個檔、261.6 行代碼。論文在兩種 Agent Scaffold 下對前沿模型進行評測,最佳解決率為 41.2%,顯示這一基準仍能有效區分當前 Coding Agent 的倉庫級工程能力。
為什麼需要 SWE-Bench ProMax
SWE-bench 建立了以真實 GitHub Issue、代碼倉庫和可執行測試評估模型補丁的基本範式。但隨著模型在傳統任務上的成績不斷提高,評測正在面臨兩個問題:一方面,局部修復任務難以充分覆蓋大型代碼庫中的結構性變更;另一方面,公開歷史補丁可能進入訓練數據,測試用例本身也可能過窄或過寬,從而影響結果的有效性。
SWE-Bench ProMax 選擇代碼重構作為主要任務形態。重構通常要求 Agent 在儘量保持外部行為穩定的前提下,對目錄結構、模塊邊界、依賴關係和代碼組織方式進行協調修改。它考察的不只是代碼生成,而是一組更接近真實軟件研發的複合能力:倉庫檢索、上下文構建、影響面分析、跨文件推理、修改規劃、工具調用、測試反饋利用和錯誤恢復。
ProMax的優勢並非簡單地「把題目做大」,而是通過任務、數據和執行環境的共同設計,提高評測的工程真實性與可解釋性。
第一,任務來自真實倉庫,並通過時間邊界降低數據污染風險
v1 的全部任務來自 2025 年之後創建的真實 GitHub Issue。相較於長期公開、可能已被模型訓練語料覆蓋的歷史任務,較新的時間截點可以顯著降低模型直接記憶已有補丁的風險。
團隊正在準備 v2,將納入更多 2026 年之後創建的任務,並計畫持續更新數據集。動態迭代機制使 Benchmark 能夠跟隨模型能力演進,減少排行榜因任務老化而過快飽和。
第二,大規模、多文件重構更接近生產級工程任務
ProMax 的 170 個任務平均修改 11.4 個檔和 261.6 行代碼,顯著高於常見的局部修復任務。一次修改可能同時影響目錄結構、導入路徑、公共接口、構建配置和測試代碼,任何遺漏都可能導致編譯失敗、補丁無法應用或回歸測試失敗。
這類任務能夠更清晰地區分不同 Agent 在長上下文理解、倉庫級搜索、任務分解和持續執行方面的能力。模型即使能正確修改某個函數,也未必能發現並處理所有關聯文件。
第三,七種語言覆蓋檢驗模型的跨生態泛化能力
ProMax v1 的語言分佈如下:
多語言覆蓋讓研究者能夠進一步觀察模型在不同類型系統、構建工具、依賴管理方式和測試框架中的能力差異,而不再將 Python 生態中的表現直接等同於通用軟件工程能力。
第四,專家重寫任務描述並人工審核測試
真實 Commit 和 Pull Request 的原始描述往往簡短、模糊,無法直接作為高質量評測題目。ProMax 對任務進行多階段專家篩選:從真實重構中識別候選任務,過濾複雜度不足或跨文件範圍有限的實例;重新編寫清晰、無歧義的任務說明;人工審查測試套件,移除可能拒絕正確替代方案的過窄測試,以及檢查了題目未聲明要求的過寬測試。
這套流程減少了「模型做對了但被測試誤判」與「模型沒有真正解決問題卻僥倖通過」的情況,使失敗原因更容易被解釋和覆核。論文也將測試質量與任務描述質量列為 ProMax 區別於既有評測的重要設計目標。
SWE-Bench ProMax 數據採集與策展流程
圖 1:SWE-Bench ProMax 的數據採集與策展流程。候選數據經過倉庫篩選、重構提交提取、Docker 環境構建、Gold Patch 與測試執行、質量過濾、問題重寫和人工覆核後,才進入正式數據集。來源:SWE-Bench ProMax 論文 Figure 3。
第五,以可執行結果驗收,不要求複刻參考補丁
每條ProMax 數據包含instance_id、repo、base_commit、problem_statement、參考patch、test_patch、語言信息及容器環境元數據。評測從指定代碼提交恢復倉庫,將模型生成的補丁應用到乾淨環境,再執行任務對應的測試腳本。
參考補丁用於證明任務存在可行解並支援質量審核,但模型不需要逐行複刻它。只要採用不同實現仍能滿足問題描述並通過行為驗證,就可以被判定為有效解。這比補丁文本相似度更符合真實軟件工程中「一項需求可能存在多種正確實現」的基本事實。
第六,容器化環境與公開執行器提高結果可複現性
ProMax 提供面向容器的環境信息和 Docker 評測執行器,固定代碼版本、依賴環境和任務執行方式。倉庫包含 Benchmark 數據、按實例組織的評測腳本、模型補丁執行器及數據收集工具;當前執行器還支援隔離網絡和離線包管理配置,以減少外部環境變化對結果的干擾。
對於模型團隊而言,這意味著評測不再只是一份靜態題目清單,而是一套可以運行、覆核和擴展的工程化基礎設施。研究者可以在相同任務版本與運行條件下比較不同模型、Agent Scaffold、上下文策略和推理預算。
41.2% 的最佳解決率意味著什麼
ProMax 的分數不應與 SWE-bench Full、Lite 或 Verified 直接橫向換算。任務規模、語言分佈、倉庫類型、測試方式和數據時間範圍不同,決定了各基準測量的是不同難度和不同側面的能力。
在 ProMax 上,解決率同時受到模型能力與 Agent 系統設計的影響。更有意義的評測報告應在同一數據版本、運行環境和推理預算下,披露總體解決率、補丁應用率、分語言結果、平均執行步數、執行時間、成本和失敗原因,並說明上下文構建、工具許可權和模型調用配置。
當前最佳結果為 41.2%,說明大多數任務仍未被前沿模型穩定解決。這個尚未飽和的難度區間,為研究倉庫級檢索、長程規劃、測試驅動修復和錯誤恢復留下了足夠的提升空間。
SWE-Bench ProMax 模型評測結果
圖 2:不同模型在 Mini-SWE-Agent 與 OpenHands 兩類 Scaffold 下的總體解決率、平均執行步數、平均成本及分語言解決率。來源:SWE-Bench ProMax 論文 Table 3。
圖中的橫向對比進一步說明,ProMax 測量的是模型與 Agent Scaffold 共同構成的軟件工程系統。例如,GPT-5.2 在 Mini-SWE-Agent 下的總體解決率為 21.8%,在 OpenHands 下提升至 41.2%;GLM-5 從 22.9% 提升至 36.5%;Claude Sonnet 4.6 則從 30.6% 提升至 38.8%。相同模型在不同執行框架下出現顯著差距,意味著倉庫流覽、工具編排、測試反饋和執行策略本身也是 Coding Agent 能力的重要組成部分。
與此同時,同一系統在不同語言上的解決率也存在明顯差異。對模型研發團隊而言,ProMax 不只提供一個總分,還可以形成分語言、分任務和分失敗類型的能力畫像,為上下文策略、工具鏈設計和後訓練數據建設提供更具體的優化方向。
從一次發佈走向持續維護
圍繞 SWE‑Bench ProMax,本原智數將與SWE-Bench ProMax團隊持續推動數據集的版本迭代、評測執行器的優化以及定期評測報告的發佈,確保基準在多語言、多倉庫任務上的覆蓋度與時效性。
本原智數將發揮在高質量數據集建設、專家組織、數據生產方法、模型評測與優化方面的能力,參與數據生產與質量保障,支持更多真實、複雜、可複現的軟件工程任務進入後續版本。雙方也將圍繞評測結果、任務設計、測試可靠性和 Agent 能力邊界開展持續交流。
專案入口(複製連結至流覽器打開)
- GitHub:https://github.com/key4127/SWE‑Bench‑ProMax
- Hugging Face:https://huggingface.co/swe‑bench‑promax/SWE‑Bench‑ProMax
- 論文:https://arxiv.org/abs/2608.09802
共建多維度AI評測專家社區
我們正在搭建一個跨領域的 Benchmark 專家社區,當前重點聚焦于代碼智能、高層次推理、視覺語言理解與長程任務等方向——這些領域正是評估下一代多模態模型推理、規劃與跨模態協同能力的關鍵試金石。社區致力於高質量任務設計、數據生產、測試質量分析與 Agent 失敗模式研究,期望為模型能力評估提供更真實、更全面的基礎設施。
我們深知,一個優秀的 Benchmark 不止是數據集的堆砌,更需要對模型能力邊界有敏銳判斷、對測試用例的有效性有嚴謹審視、對不同模型範式有深入理解。因此,我們面向模型研發、數據科學、軟件工程、測試自動化、認知科學、數學與邏輯學等多學科方向,招募真正對「如何科學評估 AI 能力」這一命題有思考、有熱情的夥伴——無論你擅長任務場景構建、數據標注與審核,還是評測執行、失敗分析與範式洞察,都歡迎參與我們的研究合作、任務生產與後續版本共建。對於希望深入投入的同學,我們也開放實習與項目合作機會。Copyright 2026 ACN Newswire. All rights reserved.
