跳到正文

#本地模型

今日 0 条
10/6周二
  1. Habr · Вайбкодинг38

    Вайбкожу Статейник:开发一个挖掘专家价值的工具

    一位有十七年营销经验的作者正在开发名为 Статейник 的工具,用于把专家本人的经验转化为文章。该工具由三层构成:语音画像、专家神经图谱,以及通过对话式提问帮助专家启动写作的机制。目前可用流程为“对话—主题—文本”,一次对话可产出多篇发布内容。

10/5周一
10/3周六
  1. Habr · Вайбкодинг31

    Yue Studio:用 YuE2 本地生成不刺耳的 AI 音乐

    开发者用 YuE2 模型做了本地 AI 音乐工具 Yue Studio,目标是避开 Suno 式“神经垃圾”,并已用它生成专辑 Static and Gold。工具包含按流派、人声、乐器生成,曲目戏剧结构、分轨、overdub、动态“呼吸”与母带处理,还提供 MCP 服务器让 AI 智能体调用。运行需 NVIDIA 显卡、CUDA 和 16 GB 显存,代码已开源。

10/2周五
9/30周三
  1. Habr · Вайбкодинг20

    Гига Писарь 发布 Mac 端大更新:重做设置界面并减少打扰

    Гига Писарь 为 Mac 端推出其史上最明显的更新,设置窗口按 macOS 系统设置风格完全重做,用左侧分区、卡片和图片取代原来的四个标签页与表格。新增「Мозг」区域可用 GigaChat 或 Qwen 本地模型改写听写文本,本地模型约 2GB 起、可一键删除,并支持多个云端服务按各自密钥切换。更新提示改为菜单栏图标上的小红点,不再弹出窗口打断用户。

9/27周日
  1. 效率火箭62

    Capsule 想把 AI 生成的小工具存为单个文件

    Capsule 是一套应用文件格式加打开它的软件,把应用封装在 .capsule 文件里双击运行,使用中产生的数据也保存在同一文件中。.capsule 本质是 SQLite 数据库文件,同时存放网页界面、代码、图片等资源和使用数据,本地运行本地存储,支持通过自带 AI 服务或用户自选服务制作和修改 App。

9/23周三
9/21周一
  1. Hacker News · Vibe Coding 讨论58

    用智能体六周做出 Pi Pocket:一次 Vibe Coding 实践复盘

    作者用智能体从零开发了 pi 的移动端前端 Pi Pocket,六周内达到 300 次提交,如今几乎不再逐行审查代码。他认为智能体适合边界清晰的小任务、重构和规划,但产出的代码普遍过度设计,规模比自己写大约 10-20%,样式和文档也偏模板化,且模型在主观判断上总顺着用户。作者目前只把这种方式用于个人项目,工作代码仍以 Claude 生成为主,自己写的不到 1%。

9/16周三
9/15周二
  1. Cline · Blog62

    Cline 发布开源桌面应用 Cline Desktop,面向开放权重模型

    Cline 发布开源桌面应用 Cline Desktop 的早期版本,把原本在 VS Code 扩展和 CLI 中的智能体运行框架搬进独立工作区,支持并行会话、定时任务和用于扩展工具与集成的 Marketplace。

    推荐理由:官方给出桌面端的能力边界与开放入口,读者可据此判断它是否适合承接多智能体并行任务。

9/10周四
9/9周三
9/8周二
8/29周六
  1. Martin Alderson38

    GLM-5.3 Flash 跑在国产硬件上意味着什么

    Z.AI 确认 GLM-5.3 Flash 的全部推理运行在国产硬件上,但未公布芯片厂商、吞吐或功耗数据,也无人独立验证。作者推测其使用的是华为昇腾 910c 系列,该芯片约 600W、INT8 算力约 1.6PFLOP/s,性能约为四年前 H100 的 60%,且缺少原生 FP8 支持。作者认为真正的瓶颈是缺乏可量产的 EUV 光刻,业界普遍认为 2030 年前难以实现规模化生产。

8/27周四
8/25周二
8/20周四
8/17周一
8/11周二
  1. Sean Goedecke · Blog52

    为什么本地模型不会胜出:批处理与 GPU 效率决定推理成本

    Sean Goedecke 认为本地模型不会成为主流,绝大多数推理仍会发生在 AI 数据中心。他给出的理由是:前沿模型体积远超消费级设备,而数据中心可通过批处理数百名用户的请求摊薄成本,加上 B200 相比 RTX 4090 在同等功耗下约有 3 倍 flops 和近 4 倍内存带宽,本地运行约需多消耗 30 倍资源;家庭推理的电力成本约每月 50 至 300 美元。

7/8周三
  1. Martin Fowler · Exploring Generative AI71

    在本地小模型上做智能体编码的实测体验

    Martin Fowler 在 M3 Max 48GB 和 M5 Pro 64GB 上实测 Qwen3.6 35B MoE、Gemma 4 31B/26B、Qwen Coder Next 80B 等本地小模型的智能体编码能力,按内存、速度、工具调用、代码正确性、上下文、任务复杂度、代码质量逐层筛选。

    推荐理由:作者用两个具体任务对比多款本地小模型的智能体编码表现,并给出可复用的任务选择标准。

7/7周二
6/27周六
  1. Этихлид48

    从代理网关到本地 Opus:AI 工程面试题深度追问清单

    一份面向 AI 工程岗位的面试题追问清单,覆盖代理网关(如 OpenRouter/LiteLLM)、MCP/CLI、从零手写 Agent、多智能体编码流程、自定义 benchmark 以及本地部署约 27B-Q3_K_M.gguf 模型等方向。作者认为,这些题目的通用版本如今谁都能靠 vibe coding 一晚做出来,已失去简历价值,真正稀缺的是把任务打磨到"理想"状态的能力。

6/22周一
5/23周六
4/28周二
4/21周二
4/13周一
4/6周一
3/31周二
  1. Paper Compute · Engineering Blog58

    Paper Compute 发布 tapes 与 stereOS,为生产环境运行 AI 智能体提供可观测与隔离基础设施

    Paper Compute 发布面向生产环境 AI 智能体的基础设施,包含 tapes 和 stereOS 两个组件。tapes 是零埋点的可观测层,以反向代理形式部署在智能体与推理服务之间,无需 SDK 或改代码,只需一个环境变量,即可捕获并生成可验证、防篡改的执行记录,并支持异常检测。

3/13周五
  1. Martin Alderson78

    如何用 Qwen 3.5 系列模型对文档做 OCR

    作者用 Qwen 3.5 系列开源多模态模型做 PDF OCR,先用 PyMuPDF 把每页按 100dpi 导出为图片,再交给模型识别,实测 Qwen3.5-9B 是效果与速度的平衡点,更小的 0.8B 到 2B 模型在复杂文档上容易跑偏去总结内容。

    推荐理由:作者实测了 Qwen 3.5 各尺寸模型做 PDF OCR 的效果,给出本地与 OpenRouter 两条可复用路径和成本数据。

3/3周二
  1. Paper Compute · Engineering Blog36

    别再优化模型了,开始加固运行时:stereOS 为 AI 智能体打造可验证执行底座

    stereOS 是一个基于 Linux 的操作系统,把 AI 编码智能体跑在各自独立的沙箱虚拟机里,每个智能体拥有独立内核、内存和磁盘,与宿主机不共享任何资源。它采用完整虚拟机而非 Firecracker、Cloud Hypervisor 等 microVM,以保留安全启动、GPU 直通和嵌套虚拟化能力,并称热 VM 可在 70ms 内让智能体执行首个有效动作。

3/1周日
  1. Martin Alderson62

    为什么端侧智能体 AI 短期内难以跟上云端

    作者 Martin Alderson 认为,端侧智能体 AI 在消费级设备上短期内难以实用,瓶颈是内存、KV cache 与推理速度。他指出 3B 模型量化后约需 2GB、7B 约需 5GB,而手机端上下文常被限制在 4K token,仅工具定义就可能占满;即便 32K 上下文,7B Q4 模型的 KV cache 也已超出 iPhone 17 的内存。

2/27周五