Space Bunny 测评:免费 Flash 模型支持 1M 上下文与原生多模态
匿名 Flash 模型 Space Bunny 在 OpenRouter 和 OpenCode 上调用量很大,支持 1M 上下文和原生多模态,作者实测其能力好过 DeepSeek V4.1 Flash,速度明显快于 GPT 6 Sol,视频理解、长程任务与 Coding 表现不错,遇到 Bug 时会自主调用视觉工具截图验证。
匿名 Flash 模型 Space Bunny 在 OpenRouter 和 OpenCode 上调用量很大,支持 1M 上下文和原生多模态,作者实测其能力好过 DeepSeek V4.1 Flash,速度明显快于 GPT 6 Sol,视频理解、长程任务与 Coding 表现不错,遇到 Bug 时会自主调用视觉工具截图验证。
一份面向开发者的免费 AI 服务清单,收录 6 个无需绑定银行卡即可使用 Claude、GPT 等顶级模型的服务。
Anthropic 在 claude-api skill 中新增 /claude-api build-eval 和 /claude-api hillclimb 两条命令,把评估集构建与爬山调优做成引导式工作流。
俄罗斯云厂商 immers.cloud 提供 NVIDIA GPU 按秒计费租用,T4 服务器 20,34 ₽/小时、H200 423,04 ₽/小时,并附超 200 个开源模型的 Immers Foundation Models 目录。
一位开发者询问如何在 Codex 与 Claude Code 等 AI 编程智能体之间切换,以应对单个工具的用量限制,核心诉求是切换时不丢失正在进行的上下文和任务。他表示找到的少数方案都缺乏关注度,并说明自己目前无法承担从每个智能体每月 20 美元涨到 100-200 美元的套餐升级。
OpenAI 在 9 月 29 日 DevDay 上发布 GPT-6.1 Sol,距离 9 月 22 日发布 GPT-6 Sol 仅一周,官方测试中接近 Astra 水准,API 标准输入输出单价为 Astra 的 1/5。
OpenAI 发布面向编程、文档处理和任务自动化的 GPT-6.1 Sol,公司称其在部分测试中接近 GPT-6 Astra。在真实代码库任务测试 DeepSWE 1.1 中,该模型追平 Astra,而执行成本约为其五分之一;在应用操控测试 OSWorld 2.0 中,最高推理档位下比 GPT-6 Sol 提升 7 个百分点。
推荐理由:GPT-6.1 Sol 在 DeepSWE 1.1 上追平 Astra 而成本约为其五分之一,读者可据此判断编程任务的性价比变化。
OpenAI 在 9 月 29 日旧金山 DevDay 上发布 GPT-6.1 Sol,API 名为 gpt-6.1-sol,定价为每百万输入 token 2 美元、输出 10 美元,缓存输入 0.10 美元,标准价格是 GPT-6 Astra 的五分之一。
推荐理由:OpenAI DevDay 发布 GPT-6.1 Sol,价格降至 Astra 的五分之一,并同步更新 Codex、Agents API 与插件体系,可据此判断成本与工具链变化。
作者用 Codex 和 GPT-5.5、GPT-5.6 Sol 从零开发远程访问工具,第一版完全交给 AI 决定架构和代码,结果项目超过 12 万行仍无法运行,修一处 bug 又引入新问题。
OpenAI 将重新向新订阅者开放 200 美元的 Pro 订阅,但调整了额度计算方式。据 Тибо Соттио 说法,按 API 消耗折算,新方案提供的用量约为旧版 Pro 200 的一半。
Tibo 发帖称 Codex 不会恢复 5 小时用量限制,用户仍可自由安排每周额度。Pro 200 美元订阅明天重新开放新用户订阅,但按 API 等价价值计算,新套餐大约只有旧版的一半 API 用量价值;明天还会给 Pro 订阅加入一些不消耗 usage 的新功能,具体未公布。
作者根据 Claude 官方新出的提示词指南,整理出在 Claude Code 中使用 Opus 5.5 的几条做法。官方称 Opus 5.5 每次回复前都会自行决定思考多少,删掉提示词里的 think carefully 后回复更早且质量没有下降,作者用 grep 命令清理了 CLAUDE.md、rules 和 Skill 中的这类指令。
Martin Alderson 认为前沿实验室的推理价格战正在加速:OpenAI 在约两个月内把 GPT-5.6 Luna 降价 90%、GPT-6 Sol 降价 60%,Anthropic 的 Opus 5.5 输入输出降价 20%、缓存读取降价 60%。
Claude Opus 5.5 被称为截止今天的世界最强模型,同时也是最便宜的模型。作者用 Claude Max Plan 20x 实测:月费 $200 美金,5 天消耗 164 亿 Token,折合每月可消耗 600 亿 Token,考虑缓存后实际价值约 $15000~$20000。
作者导出自己 49 个 Claude Code 会话、138 小时活跃工作的日志,统计出每小时平均消耗 1530 万缓存读取、86 万缓存写入、5.1 万输出和 560 普通输入 token,再按这套固定用量给 TeamoRouter、LiteAI、RouterAI、Polza AI、ProxyAPI 五家 API 网关算每小时花费。
NGENIX 提供无清洗中心的云端 DDoS 与机器人防护,L3/L4 过滤默认开启、L7 过滤从 Lite 套餐起提供,宣称可缓解 7+ Тбит/с 和 5 М+ RPS 的攻击,平台每日处理 60 亿次请求并拦截 2 亿次。
即梦AI网页版上线「样片模式」,先用480P生成草稿、满意后再原生升清为1080P成片,480P成本仅为1080P的1/8。以即梦998元连续包月档为例,15s视频480P抽卡2次加升清共99元,直接1080P抽卡则需156元,省38%。该模式在画布中也可用,保留Seedance 2.5的全能参考、首尾帧、智能编辑能力,暂不支持3分钟超长视频。
有用户在 Codex 定时任务中设置每天 5:50、11:00、16:10 发送内容为 111 的消息,并忽略技能、上下文和记忆,以此触发额度消耗、提前重置 5 小时限额,实测消耗约 2%。该方法受触发时间和模型强度影响,6-luna 因消耗过省无法触发,改用 6-sol 轻度后可正常触发;后续该方式在 Codex 上失效,但在 Claude 上仍可正常触发。
一位开发者用两个晚上靠 AI 写出一个猫粮商店,工具确实好用,但作者提醒:从"我配好了自动浇水"到"农艺师不再被需要"之间还有很大距离。他建议开发者先在自身实验里弄清哪些活能交给 AI、哪些必须逐步检查、哪些自己做更省心,并注意助手反复修补上一次修补后果时,方案就已不再划算。作者还指出,"加快团队速度"的要求背后往往藏着缺乏规划、承诺 4 周变 8 周等真问题,而 AI 只是被预先选好的手段。
开发者发布自托管开源 LLM 网关 Inferrail,可把模型调用归集为单次任务的成本,例如 20 次模型调用对应 1 个任务、花费 $0.43,且不保存提示词和响应。
Thorsten Ball 在 Register Spill 的 Joy & Curiosity #101 中提出,框架已不再是最大的开发者生产力杠杆,AI 智能体比它大一百倍,语法和工具易用性也不再重要。
Rust 开发者 Nikita 认为 AI 只加速了写代码这一段,上下文准备、审查、测试和修复仍要人来做,因此该按“到可上线改动”的时间算收益,而不是按模型首次响应算。
未发布的 ChatGPT 订阅配置中出现新档位 Pro Max,据 TestingCatalog 称月费 500 美元,是现价 200 美元 Pro 的 2.5 倍。
PureblueAI 鲁扬提出 GEO 与 SEO 是两个物种:SEO 有规则可循,GEO 是黑盒,只能用一个模型去学习另一个模型。他把 AI 引用内容拆成漏斗,用因子挖掘的方式做 GEO,并指出豆包偏爱抖音视频、海外模型偏爱官网和 Reddit。他认为 prompt 正在成为新货架,AI 消费闭环已开启,酒旅品类已开始抽佣,常规 8 个点、部分品类 12 个点。
豆包工作完成一轮升级,新增目标模式和计划模式,并上线任务队列、在线编辑 md 文件等能力。目标模式按预设验收标准逐项校验、不达标自动返工;计划模式先输出 Markdown 实施计划,确认后才动文件,作者称同一复杂任务走计划模式的 token 消耗更低。豆包 2.1 Pro 更新后,大部分编程工作也可在豆包工作内完成,并直接输出 markdown、HTML、飞书文档等格式。
OpenAI 于 9 月 22 日在 API 发布 gpt-6-sol 和 gpt-6-luna,两者接受文本和图像输入、只生成文本。标准处理下,GPT-6 Sol 每百万输入 token 收费 2 美元、缓存 token 0.20 美元、输出 10 美元;GPT-6 Luna 分别为 0.10、0.01 和 0.50 美元。
TypeSafe 创始人 Diogo Almeida 发布笔记,提出把 coding agent 的 harness 围绕 Jev 重构:大模型负责写代码和复杂推理,Jev 负责选工具、挑上下文、路由请求等高频小决策,输入状态和问题,输出选项、评分或断言为真的概率,再由普通代码使用这些结果。
Anthropic 于 9 月 22 日发布旗舰模型 Claude Opus 5.5,面向让智能体执行编程、数据分析等多步任务的开发者与团队,官方称相比 Opus 5 性能提升且成本下降。
推荐理由:Anthropic 官方公布的定价与默认负载成本降幅,可帮开发者判断长时智能体任务的迁移成本。
MiMo-V2.6-Pro debuts as the top open weights model on the Artificial Analysis Intelligence Index (46). At $0.13 per Intelligence Index task, it lands on the Intelligence vs. Cost per Task Pareto frontier @Xiaomi has just released MiMo-V2.6-Pro, an open weights model with major advances in intelligence over its predecessor, MiMo-V2.5-Pro (Intelligence Index: 26). Despite the improvement, it retains the same attractive pricing at $0.435 per 1M input tokens (with a 99% cache-hit discount) and $0.87 per 1M output tokens. This makes MiMo-V2.6-Pro one of the most cost-efficient models to deploy. MiMo-V2.6-Pro is an MoE model with 1.02T total parameters and 42B active parameters. Stay tuned for additional analysis of the model. Check out MiMo-V2.6-Pro full benchmarking breakdown here: https://artificialanalysis.ai
作者发现 Cursor 在 2026 年 7 月 31 日撤下了 Usage 页面的美元金额,只保留 token 数和 Included 标记,连历史记录也被追溯清零。
俄罗斯软件公司 Diasoft 董事会成员 Alexander Sakharov 提出,语言模型本身只贡献约 2% 的 AI 开发成果,其余 98% 来自指令、门禁、流程、记忆和人员构成的“生态”。Diasoft 的 AI Driven 版 Digital Q 生态由约 40 个智能体组成,每个阶段都设有质量门禁,团队约 20 人、耗时六个月完成向智能体方案的全面切换。
Paper Compute 工程师用 TypeSafe 的 Jev 做智能体会话标签实验,在 1,781 条工程师对话轮次上,Jev 1.13.0 中位响应 188 ms,比 GPT-4o mini 的 1,023 ms 和 Claude Haiku 4.5 的 1,050 ms 快约 5.4 倍和 5.6 倍,本地 Qwen3 8B 为 2,311 ms。
作者给出用 OpenRouter 把 Claude Code 接到任意模型的做法:把 OPENROUTER_API_KEY 放在 ~/.config/openrouter.env。
推荐理由:作者用约二十行 shell 把 Claude Code 的 harness 与模型解耦,并给出四个模型槽位的路由与踩坑细节。
Quesma 举办首届 token 经济学黑客松,五支队伍用一晚时间分析 18 GB 编程智能体对话记录,寻找 token 浪费点。有团队发现压缩上下文后 59% 的文件读取是重复读取,Codex 会话中压缩占比 25.9%、Claude Code 为 10.3%;另有队伍做出 Progress Guard 演示,用于检测智能体反复跑测试却不改代码的死循环。
作者统计上月 1731 次智能体会话、花费 17816 美元,能精确到每次会话的成本、模型和目录,却无法回答这些工作是为了什么。
文章用概率模型算出,失败率 1% 的测试要跑 299 次才有 95% 概率被发现,而单次重跑有 99% 概率变绿,因此重跑通过几乎不提供信息。作者建议智能体循环中不要用重跑覆盖原始失败记录,并把已知不稳定测试单独标记,例如用 pytest-rerunfailures 的 @pytest.mark.flaky(reruns=n) 按测试标注,而不是全局 --reruns 3。
System One 模型如 Jev 是快速通用分类器,可像 LLM 一样通过提示词处理多种任务。作者认为,由于 Jev 需要针对具体任务提示,成功的使用场景可以很容易地蒸馏成专用分类器,后者在特定任务上更快、更便宜。
Cursor Composer 变慢、token 消耗快,常见原因是多个 .mdc 文件设了 alwaysApply: true,4 到 5 条规则会给每轮对话前置 3000+ token 的静态指令,到第 10 轮时 prompt prefill 延迟明显上升。
作者在 Z.AI API 前搭了本地网关 claude-code-router,让 Claude Code 同一会话里跑两个模型:glm-5.3 负责推理、规划。
作者在自家产品中实测了 Jev 模型,它通过 Choice 选择答案、Noul 二选一作答并给出各选项概率,特点是并行生成、速度快且便宜。