Terminal-Bench-Science 0.1 发布:70 项科研任务,Claude Opus 5 解决率 30%
斯坦福大学研究人员主导、Terminal-Bench 团队联合全球科研机构专家打造的 Terminal-Bench-Science 0.1 发布,首批含生命、物理、地球、数学和工程科学领域的 70 项任务。
斯坦福大学研究人员主导、Terminal-Bench 团队联合全球科研机构专家打造的 Terminal-Bench-Science 0.1 发布,首批含生命、物理、地球、数学和工程科学领域的 70 项任务。
Cline 让八个模型在自家 harness 里做 IMO 2026 六道题,证明由 GPT-5.5 和 Claude Opus 5 双盲按 0–7 分制评分、Gemini 3.1 Pro 仲裁,金牌线为 29 分。
推荐理由:Cline 用同一套 harness 盲评八个模型做 IMO 2026,给出分数与单次成本对照,可看开源权重模型的实际性价比。