Space Bunny 测评:免费 Flash 模型支持 1M 上下文与原生多模态
匿名 Flash 模型 Space Bunny 在 OpenRouter 和 OpenCode 上调用量很大,支持 1M 上下文和原生多模态,作者实测其能力好过 DeepSeek V4.1 Flash,速度明显快于 GPT 6 Sol,视频理解、长程任务与 Coding 表现不错,遇到 Bug 时会自主调用视觉工具截图验证。
Awaiting translation
匿名 Flash 模型 Space Bunny 在 OpenRouter 和 OpenCode 上调用量很大,支持 1M 上下文和原生多模态,作者实测其能力好过 DeepSeek V4.1 Flash,速度明显快于 GPT 6 Sol,视频理解、长程任务与 Coding 表现不错,遇到 Bug 时会自主调用视觉工具截图验证。
Awaiting translation
一份面向开发者的免费 AI 服务清单,收录 6 个无需绑定银行卡即可使用 Claude、GPT 等顶级模型的服务。
Awaiting translation
Anthropic 在 claude-api skill 中新增 /claude-api build-eval 和 /claude-api hillclimb 两条命令,把评估集构建与爬山调优做成引导式工作流。
Awaiting translation
俄罗斯云厂商 immers.cloud 提供 NVIDIA GPU 按秒计费租用,T4 服务器 20,34 ₽/小时、H200 423,04 ₽/小时,并附超 200 个开源模型的 Immers Foundation Models 目录。
Awaiting translation
一位开发者询问如何在 Codex 与 Claude Code 等 AI 编程智能体之间切换,以应对单个工具的用量限制,核心诉求是切换时不丢失正在进行的上下文和任务。他表示找到的少数方案都缺乏关注度,并说明自己目前无法承担从每个智能体每月 20 美元涨到 100-200 美元的套餐升级。
Awaiting translation
OpenAI 在 9 月 29 日 DevDay 上发布 GPT-6.1 Sol,距离 9 月 22 日发布 GPT-6 Sol 仅一周,官方测试中接近 Astra 水准,API 标准输入输出单价为 Astra 的 1/5。
Awaiting translation
OpenAI has released GPT-6.1 Sol for coding, document processing, and task automation. The company says it comes close to GPT-6 Astra on some tests. On DeepSWE 1.1, a benchmark of real-world codebase tasks, the model matches Astra while costing about one-fifth as much to run. On OSWorld 2.0, which tests app control, it beats GPT-6 Sol by 7 percentage points at the highest reasoning tier.
Why it matters: GPT-6.1 Sol matches Astra on DeepSWE 1.1 at roughly one-fifth the cost, which gives you a sense of how the price-performance tradeoff for coding tasks has shifted.
OpenAI 在 9 月 29 日旧金山 DevDay 上发布 GPT-6.1 Sol,API 名为 gpt-6.1-sol,定价为每百万输入 token 2 美元、输出 10 美元,缓存输入 0.10 美元,标准价格是 GPT-6 Astra 的五分之一。
Awaiting translation
Why it matters: OpenAI DevDay 发布 GPT-6.1 Sol,价格降至 Astra 的五分之一,并同步更新 Codex、Agents API 与插件体系,可据此判断成本与工具链变化。
作者用 Codex 和 GPT-5.5、GPT-5.6 Sol 从零开发远程访问工具,第一版完全交给 AI 决定架构和代码,结果项目超过 12 万行仍无法运行,修一处 bug 又引入新问题。
Awaiting translation
OpenAI 将重新向新订阅者开放 200 美元的 Pro 订阅,但调整了额度计算方式。据 Тибо Соттио 说法,按 API 消耗折算,新方案提供的用量约为旧版 Pro 200 的一半。
Awaiting translation
Tibo 发帖称 Codex 不会恢复 5 小时用量限制,用户仍可自由安排每周额度。Pro 200 美元订阅明天重新开放新用户订阅,但按 API 等价价值计算,新套餐大约只有旧版的一半 API 用量价值;明天还会给 Pro 订阅加入一些不消耗 usage 的新功能,具体未公布。
Awaiting translation
作者根据 Claude 官方新出的提示词指南,整理出在 Claude Code 中使用 Opus 5.5 的几条做法。官方称 Opus 5.5 每次回复前都会自行决定思考多少,删掉提示词里的 think carefully 后回复更早且质量没有下降,作者用 grep 命令清理了 CLAUDE.md、rules 和 Skill 中的这类指令。
Awaiting translation
Martin Alderson 认为前沿实验室的推理价格战正在加速:OpenAI 在约两个月内把 GPT-5.6 Luna 降价 90%、GPT-6 Sol 降价 60%,Anthropic 的 Opus 5.5 输入输出降价 20%、缓存读取降价 60%。
Awaiting translation
Claude Opus 5.5 被称为截止今天的世界最强模型,同时也是最便宜的模型。作者用 Claude Max Plan 20x 实测:月费 $200 美金,5 天消耗 164 亿 Token,折合每月可消耗 600 亿 Token,考虑缓存后实际价值约 $15000~$20000。
Awaiting translation
作者导出自己 49 个 Claude Code 会话、138 小时活跃工作的日志,统计出每小时平均消耗 1530 万缓存读取、86 万缓存写入、5.1 万输出和 560 普通输入 token,再按这套固定用量给 TeamoRouter、LiteAI、RouterAI、Polza AI、ProxyAPI 五家 API 网关算每小时花费。
Awaiting translation
NGENIX 提供无清洗中心的云端 DDoS 与机器人防护,L3/L4 过滤默认开启、L7 过滤从 Lite 套餐起提供,宣称可缓解 7+ Тбит/с 和 5 М+ RPS 的攻击,平台每日处理 60 亿次请求并拦截 2 亿次。
Awaiting translation
即梦AI网页版上线「样片模式」,先用480P生成草稿、满意后再原生升清为1080P成片,480P成本仅为1080P的1/8。以即梦998元连续包月档为例,15s视频480P抽卡2次加升清共99元,直接1080P抽卡则需156元,省38%。该模式在画布中也可用,保留Seedance 2.5的全能参考、首尾帧、智能编辑能力,暂不支持3分钟超长视频。
Awaiting translation
有用户在 Codex 定时任务中设置每天 5:50、11:00、16:10 发送内容为 111 的消息,并忽略技能、上下文和记忆,以此触发额度消耗、提前重置 5 小时限额,实测消耗约 2%。该方法受触发时间和模型强度影响,6-luna 因消耗过省无法触发,改用 6-sol 轻度后可正常触发;后续该方式在 Codex 上失效,但在 Claude 上仍可正常触发。
Awaiting translation
一位开发者用两个晚上靠 AI 写出一个猫粮商店,工具确实好用,但作者提醒:从"我配好了自动浇水"到"农艺师不再被需要"之间还有很大距离。他建议开发者先在自身实验里弄清哪些活能交给 AI、哪些必须逐步检查、哪些自己做更省心,并注意助手反复修补上一次修补后果时,方案就已不再划算。作者还指出,"加快团队速度"的要求背后往往藏着缺乏规划、承诺 4 周变 8 周等真问题,而 AI 只是被预先选好的手段。
Awaiting translation
开发者发布自托管开源 LLM 网关 Inferrail,可把模型调用归集为单次任务的成本,例如 20 次模型调用对应 1 个任务、花费 $0.43,且不保存提示词和响应。
Awaiting translation
Thorsten Ball 在 Register Spill 的 Joy & Curiosity #101 中提出,框架已不再是最大的开发者生产力杠杆,AI 智能体比它大一百倍,语法和工具易用性也不再重要。
Awaiting translation
Rust 开发者 Nikita 认为 AI 只加速了写代码这一段,上下文准备、审查、测试和修复仍要人来做,因此该按“到可上线改动”的时间算收益,而不是按模型首次响应算。
Awaiting translation
未发布的 ChatGPT 订阅配置中出现新档位 Pro Max,据 TestingCatalog 称月费 500 美元,是现价 200 美元 Pro 的 2.5 倍。
Awaiting translation
PureblueAI 鲁扬提出 GEO 与 SEO 是两个物种:SEO 有规则可循,GEO 是黑盒,只能用一个模型去学习另一个模型。他把 AI 引用内容拆成漏斗,用因子挖掘的方式做 GEO,并指出豆包偏爱抖音视频、海外模型偏爱官网和 Reddit。他认为 prompt 正在成为新货架,AI 消费闭环已开启,酒旅品类已开始抽佣,常规 8 个点、部分品类 12 个点。
Awaiting translation
豆包工作完成一轮升级,新增目标模式和计划模式,并上线任务队列、在线编辑 md 文件等能力。目标模式按预设验收标准逐项校验、不达标自动返工;计划模式先输出 Markdown 实施计划,确认后才动文件,作者称同一复杂任务走计划模式的 token 消耗更低。豆包 2.1 Pro 更新后,大部分编程工作也可在豆包工作内完成,并直接输出 markdown、HTML、飞书文档等格式。
Awaiting translation
OpenAI 于 9 月 22 日在 API 发布 gpt-6-sol 和 gpt-6-luna,两者接受文本和图像输入、只生成文本。标准处理下,GPT-6 Sol 每百万输入 token 收费 2 美元、缓存 token 0.20 美元、输出 10 美元;GPT-6 Luna 分别为 0.10、0.01 和 0.50 美元。
Awaiting translation
TypeSafe 创始人 Diogo Almeida 发布笔记,提出把 coding agent 的 harness 围绕 Jev 重构:大模型负责写代码和复杂推理,Jev 负责选工具、挑上下文、路由请求等高频小决策,输入状态和问题,输出选项、评分或断言为真的概率,再由普通代码使用这些结果。
Awaiting translation
On September 22, Anthropic released its flagship model Claude Opus 5.5, aimed at developers and teams who want agents to handle multi-step tasks like coding and data analysis. The company says it delivers better performance and lower cost than Opus 5.
Why it matters: Anthropic's published pricing and the default workload cost reduction help developers estimate the migration cost for long-running agent tasks.
Awaiting translation
MiMo-V2.6-Pro debuts as the top open weights model on the Artificial Analysis Intelligence Index (46). At $0.13 per Intelligence Index task, it lands on the Intelligence vs. Cost per Task Pareto frontier @Xiaomi has just released MiMo-V2.6-Pro, an open weights model with major advances in intelligence over its predecessor, MiMo-V2.5-Pro (Intelligence Index: 26). Despite the improvement, it retains the same attractive pricing at $0.435 per 1M input tokens (with a 99% cache-hit discount) and $0.87 per 1M output tokens. This makes MiMo-V2.6-Pro one of the most cost-efficient models to deploy. MiMo-V2.6-Pro is an MoE model with 1.02T total parameters and 42B active parameters. Stay tuned for additional analysis of the model. Check out MiMo-V2.6-Pro full benchmarking breakdown here: https://artificialanalysis.ai
作者发现 Cursor 在 2026 年 7 月 31 日撤下了 Usage 页面的美元金额,只保留 token 数和 Included 标记,连历史记录也被追溯清零。
Awaiting translation
俄罗斯软件公司 Diasoft 董事会成员 Alexander Sakharov 提出,语言模型本身只贡献约 2% 的 AI 开发成果,其余 98% 来自指令、门禁、流程、记忆和人员构成的“生态”。Diasoft 的 AI Driven 版 Digital Q 生态由约 40 个智能体组成,每个阶段都设有质量门禁,团队约 20 人、耗时六个月完成向智能体方案的全面切换。
Awaiting translation
Paper Compute 工程师用 TypeSafe 的 Jev 做智能体会话标签实验,在 1,781 条工程师对话轮次上,Jev 1.13.0 中位响应 188 ms,比 GPT-4o mini 的 1,023 ms 和 Claude Haiku 4.5 的 1,050 ms 快约 5.4 倍和 5.6 倍,本地 Qwen3 8B 为 2,311 ms。
Awaiting translation
The author shows how to connect Claude Code to any model with OpenRouter: put OPENROUTER_API_KEY in ~/.config/openrouter.env.
Why it matters: With about twenty lines of shell, the author decouples Claude Code's harness from the model and shares the routing and pitfalls for four model slots.
Quesma 举办首届 token 经济学黑客松,五支队伍用一晚时间分析 18 GB 编程智能体对话记录,寻找 token 浪费点。有团队发现压缩上下文后 59% 的文件读取是重复读取,Codex 会话中压缩占比 25.9%、Claude Code 为 10.3%;另有队伍做出 Progress Guard 演示,用于检测智能体反复跑测试却不改代码的死循环。
Awaiting translation
作者统计上月 1731 次智能体会话、花费 17816 美元,能精确到每次会话的成本、模型和目录,却无法回答这些工作是为了什么。
Awaiting translation
文章用概率模型算出,失败率 1% 的测试要跑 299 次才有 95% 概率被发现,而单次重跑有 99% 概率变绿,因此重跑通过几乎不提供信息。作者建议智能体循环中不要用重跑覆盖原始失败记录,并把已知不稳定测试单独标记,例如用 pytest-rerunfailures 的 @pytest.mark.flaky(reruns=n) 按测试标注,而不是全局 --reruns 3。
Awaiting translation
System One 模型如 Jev 是快速通用分类器,可像 LLM 一样通过提示词处理多种任务。作者认为,由于 Jev 需要针对具体任务提示,成功的使用场景可以很容易地蒸馏成专用分类器,后者在特定任务上更快、更便宜。
Awaiting translation
Cursor Composer 变慢、token 消耗快,常见原因是多个 .mdc 文件设了 alwaysApply: true,4 到 5 条规则会给每轮对话前置 3000+ token 的静态指令,到第 10 轮时 prompt prefill 延迟明显上升。
Awaiting translation
作者在 Z.AI API 前搭了本地网关 claude-code-router,让 Claude Code 同一会话里跑两个模型:glm-5.3 负责推理、规划。
Awaiting translation
作者在自家产品中实测了 Jev 模型,它通过 Choice 选择答案、Noul 二选一作答并给出各选项概率,特点是并行生成、速度快且便宜。
Awaiting translation