rshop-hk.com

编程智能体评测改写:Terminal-Bench 比「会写函数」更能拉开差距

AI新闻 · 大模型

2026 年的编码评测已经从「补全一行代码」转到「在真实终端里改仓库」。Artificial Analysis 的 Coding Agent Index 把 DeepSWE、Terminal-Bench v2、SWE-Atlas-QnA 绑在一起,GPT-5.6 Sol 在部分设置下能拿到约 80 的综合分,并在多项上领先或并列。

Claude 仍常在 SWE-Bench Pro、LMArena 编程偏好上表现突出,尤其是多文件重构。Gemini 3.1 Pro 把常规 SWE-bench Verified 追到约 80% 量级,但最难的工程任务仍被看成追赶中。数字会变,方法不会变:没有 harness 的裸模型分,越来越难代表生产。

站点在转述这类新闻时,应写清「配了哪种智能体框架、推理档位、是否厂商自测」,否则读者会把三张不可比的表当成同一场比赛。