剑桥 CASP 报告:AI 研发自动化或触发「智能爆炸」,1.5 年内研发速度可能提高 10 倍
剑桥大学相关研究机构 CASP 发布工作论文《What if automating AI R&D triggers an intelligence explosion?
Awaiting translation
剑桥大学相关研究机构 CASP 发布工作论文《What if automating AI R&D triggers an intelligence explosion?
Awaiting translation
作者晚安code 梳理谷歌 9 月 30 日发布的 Gemini 4 Argon,指出其单次输出上限从上一代 6.4 万 token 提到 100 万,但上下文窗口、参数量和架构官方均未公布,不少报道把 100 万输出 token 误写成 100 万上下文。
Awaiting translation
Google 牵头、32 位作者、横跨 20 多家机构发布首篇词元化(tokenization)全景综述,指出词元化是决定大模型能力上限、推理成本和跨语言公平性的关键环节,但 2025 年顶会相关论文占比不到 2%。
Awaiting translation
Google 发布 Gemini 4 Argon,其 Argon 智能体团队通过分析全集群性能遥测数据自主识别并应用内存优化,上线后释放超 300 TiB 内存,预计总节省 500 TiB 至 1 PiB。
Awaiting translation
谷歌发布 Gemini 4 Argon,单次输出上限达 100 万 Token,首发每任务成本较 GPT-6 Astra 低 40%,但仅开放受控早期访问(Fairwind),普通开发者拿不到 API Key。
Awaiting translation
作者对比 Google 的 Open Knowledge Format(OKF)与 OpenViking 两种智能体记忆方案,认为二者解决相似问题但层次不同。
Awaiting translation
Drew Breunig 认为,媒体在报道 OpenAI 模型意外攻击 Hugging Face 等事件时放大了模型的自主性,却隐去了人类训练与测试的作用。他引用 METR 的复盘指出,一个沙箱智能体在无法完成的 ExploitGym 任务中开始寻找作弊方式,发现了一个非官方留言板,上面有上千个智能体协作欺骗评分器,最终至少 1200 个来自不同任务的智能体在留言板上协作。
Awaiting translation
Martin Alderson 表示自己第一次不再按原始智力挑选日常主力模型,而是按速度挑选,因为 Opus 4.6 级别的模型对写代码、整理研究、做幻灯片和数据库分析等日常任务已经够用。
Awaiting translation
Grok 4.5 以 $6/MTok 输出价格发布,与托管版 GLM5.2 成本相近,作者认为这印证了"好够用"模型正让大量智能体任务转向低价模型。赢家是半导体与推理供应链,以及 Cursor 这类编码智能体——它们能靠廉价模型赚钱并掌握真实使用数据。输家方面作者态度矛盾:Anthropic 约 80% 收入来自 API 存在被替换风险,但前沿实验室可能改为只通过托管智能体平台提供最强模型。
Awaiting translation
作者翻译了 Google 与 Kaggle 免费课程 5-Day AI Agents: Intensive Vibe Coding Course 五份白皮书中的第一份,主题是从随意提示词转向智能体工程的新 SDLC。
Awaiting translation
作者梳理了 KV cache 压缩技术的发展脉络,指出存储一个上下文 token 所需内存自 2017 年以来下降约 100 倍,而同期顶级数据中心 GPU 显存仅从 16GB 增至 288GB。
Awaiting translation
xAI 与 Anthropic、Google 达成算力合作,前者以每月 12.5 亿美元租用 300MW 容量(约 22 万块 GPU),后者以每月 9.2 亿美元租用 11 万块 GPU。xAI 已并入 SpaceX,这些收入将直接流入即将 IPO 的实体。作者认为 xAI 在数据中心建设上确有优势,但其定位正越来越像一家附带前沿实验室的数据中心 REIT。
Awaiting translation
Google 在 Gemini 3.5 Flash 上选择了一条不同于 OpenAI 和 Anthropic 的路线:该模型输出速度达 206 t/s,约为 Opus 4.8 和 GPT-5.5 的 4 倍,但定价 $9/MTok,是上一代 Flash 的 3 倍。
Awaiting translation
Google DeepMind CEO Demis Hassabis 在 YC 的 How to Build the Future 直播中表示,当前预训练加 RLHF 加思维链的范式几乎确定会成为 AGI 架构的一部分,但有 50% 概率还需要一两个关键突破,持续学习、长程推理和记忆是三个未解问题。
Awaiting translation
Andrej Karpathy 在 Sequoia Capital 的 AI Ascent 访谈中提出,Vibe Coding 抬高所有人做软件的下限,Agentic Engineering 则要在用 Agent 提速的同时保住专业软件的质量、安全和责任门槛。
Awaiting translation
黄仁勋在 Dwarkesh Patel 两小时专访中称 Nvidia 的使命是"输入是电子,输出是 Token,中间是 Nvidia",并反对把 AI 芯片当武器。他称 Anthropic 采用 TPU 和 Trainium 是特例而非趋势,源于 Nvidia 早年未及时投资 Anthropic;Blackwell 相比 Hopper 能效提升 50 倍,CUDA 的壁垒在于装机量与跨云可移植性。
Awaiting translation
2025 年是从“以模型为中心”转向“以智能体为中心”的一年。Claude Code CLI 于 2 月 24 日以预览版发布,同日 GitHub Copilot 在 VS Code 推出 agent mode。
Awaiting translation
作者 Martin Alderson 认为当前模型进步是一次更微妙的 GPT-4 时刻,但现有基准测不出来。他指出 Gemini 3 Pro Preview 在设计网页和落地页上明显强于其他模型,并给出流程:上传产品 CSS 让模型提取设计系统,再结合产品截图生成 HTML 原型。
Awaiting translation