Перейти к содержимому

#Локальные модели

Сегодня 0 материалов
06.10вт
  1. DEV Community · MCP78

    Ловушка FP8: счёт за GPU упал на 47%, а модель выдаёт «!!!!!!»

    Автор запустил Qwen2.5 7B/32B/72B на одной AMD MI300X через vLLM для ROCm по цене $2.99 за GPU-час; базовый уровень BF16 — $0.227 за миллион выходных токенов для 7B, $0.77 для 32B и $1.67 для 72B.

    Почему это важно: Автор протестировал FP8-квантизацию на MI300X и обнаружил, что оплата по токенам маскирует деградацию вывода в бессмыслицу, и предложил воспроизводимый способ проверки.

  2. Reddit · ClaudeCode / Codex / VibeCoding22

    手机端可用 Codex Voice Mode:应用内嵌 Ubuntu 运行本地 Codex

    一款应用现已支持在手机上使用 Codex Voice Mode,目前仅支持本地 Codex,通过内嵌 Termux proot 环境运行 Ubuntu,让 Codex 直接在手机上运行。Codex Cloud 与 Remote Control 支持即将推出,该应用目前闭源,可从公开仓库免费下载。

    Ожидает перевода

  3. Habr · Вайбкодинг38

    Вайбкожу Статейник:开发一个挖掘专家价值的工具

    一位有十七年营销经验的作者正在开发名为 Статейник 的工具,用于把专家本人的经验转化为文章。该工具由三层构成:语音画像、专家神经图谱,以及通过对话式提问帮助专家启动写作的机制。目前可用流程为“对话—主题—文本”,一次对话可产出多篇发布内容。

    Ожидает перевода

05.10пн
  1. Reddit · ClaudeCode / Codex / VibeCoding20

    Если запустить локальный glm 5.3 вместе с агентом openclaw и писать код по 24/7, этот рабочий процесс уже устарел?

    Один разработчик берёт заказы в чате через агента openclaw, код пишет PI coding agent, локально запускает glm 5.3 и иногда привлекает передовые модели для ревью, а для мозгового штурма и спецификаций требований использует ChatGPT 5.6 sol; задачи он ведёт в собственном развёрнутом репозитории Gitea.

03.10сб
  1. Habr · Вайбкодинг31

    Yue Studio: локальная генерация нерезкой AI-музыки с помощью YuE2

    Разработчик сделал локальный инструмент для AI-музыки Yue Studio на модели YuE2, чтобы уйти от «нейронного мусора» в духе Suno, и уже сгенерировал с его помощью альбом Static and Gold. В инструменте есть генерация по жанрам, вокалу и инструментам, драматургия трека, разделение на дорожки, overdub, динамическое «дыхание» и мастеринг, а также MCP-сервер, чтобы инструмент могли вызывать ИИ-агенты. Для работы нужны видеокарта NVIDIA, CUDA и 16 ГБ видеопамяти; код открыт.

02.10пт
  1. Shreya Shankar36

    用决策模型(如 Jev)逐行调用 API 处理数千行数据效率极低,无法利用查询规划。在单张 H100 上,Qwen3-4B 对 5k 条电影评论做一次 AI 过滤的理论最快速度约为 6.6 秒,目前包括开源 AI-SQL 引擎 Quail 在内的任何系统都远未接近。新博客文章介绍了 Quail 如何基于这一速度上限估算 AI 过滤器的成本。

    Ожидает перевода

30.09ср
  1. Habr · Вайбкодинг20

    Гига Писарь 发布 Mac 端大更新:重做设置界面并减少打扰

    Гига Писарь 为 Mac 端推出其史上最明显的更新,设置窗口按 macOS 系统设置风格完全重做,用左侧分区、卡片和图片取代原来的四个标签页与表格。新增「Мозг」区域可用 GigaChat 或 Qwen 本地模型改写听写文本,本地模型约 2GB 起、可一键删除,并支持多个云端服务按各自密钥切换。更新提示改为菜单栏图标上的小红点,不再弹出窗口打断用户。

    Ожидает перевода

27.09вс
  1. 效率火箭62

    Capsule 想把 AI 生成的小工具存为单个文件

    Capsule 是一套应用文件格式加打开它的软件,把应用封装在 .capsule 文件里双击运行,使用中产生的数据也保存在同一文件中。.capsule 本质是 SQLite 数据库文件,同时存放网页界面、代码、图片等资源和使用数据,本地运行本地存储,支持通过自带 AI 服务或用户自选服务制作和修改 App。

    Ожидает перевода

23.09ср
21.09пн
  1. Hacker News · Vibe Coding 讨论58

    用智能体六周做出 Pi Pocket:一次 Vibe Coding 实践复盘

    作者用智能体从零开发了 pi 的移动端前端 Pi Pocket,六周内达到 300 次提交,如今几乎不再逐行审查代码。他认为智能体适合边界清晰的小任务、重构和规划,但产出的代码普遍过度设计,规模比自己写大约 10-20%,样式和文档也偏模板化,且模型在主观判断上总顺着用户。作者目前只把这种方式用于个人项目,工作代码仍以 Claude 生成为主,自己写的不到 1%。

    Ожидает перевода

16.09ср
15.09вт
  1. Cline · Blog62

    Cline выпускает открытое настольное приложение Cline Desktop для моделей с открытыми весами

    Cline выпустил раннюю версию открытого настольного приложения Cline Desktop: фреймворк для запуска ИИ-агентов, который раньше жил в расширении для VS Code и в CLI, переехал в отдельное рабочее пространство. Поддерживаются параллельные сессии, задачи по расписанию и Marketplace для расширения инструментов и интеграций.

    Почему это важно: В официальной документации описаны границы возможностей настольной версии и открытые точки входа — по ним можно оценить, подходит ли она для параллельных задач с участием нескольких ИИ-агентов.

10.09чт
  1. Hacker News · AI 编程经验问答22

    HN 讨论:你的 AI 编程环境是怎么搭的?

    一位开发者分享自己的 AI 编程配置:主力用 Claude Code、Codex 和 opencode(接 Z.ai GLM-5.x),偶尔用 Gemini,主要在 Mac iTerm2 或 Arch Linux 终端里工作,emacs 偶尔充当编程智能体,很少用 JetBrains IDE 或 vscode。

    Ожидает перевода

09.09ср
08.09вт
29.08сб
  1. Martin Alderson38

    GLM-5.3 Flash 跑在国产硬件上意味着什么

    Z.AI 确认 GLM-5.3 Flash 的全部推理运行在国产硬件上,但未公布芯片厂商、吞吐或功耗数据,也无人独立验证。作者推测其使用的是华为昇腾 910c 系列,该芯片约 600W、INT8 算力约 1.6PFLOP/s,性能约为四年前 H100 的 60%,且缺少原生 FP8 支持。作者认为真正的瓶颈是缺乏可量产的 EUV 光刻,业界普遍认为 2030 年前难以实现规模化生产。

    Ожидает перевода

27.08чт
  1. Cline · Blog71

    Cline протестировал восемь моделей на задачах IMO 2026: DeepSeek V4 Flash взял золотую планку всего за 0.12 доллара

    Cline прогнал восемь моделей через собственный harness на шести задачах IMO 2026. Решения оценивали вслепую по 0–7-балльной шкале два эксперта — GPT-5.5 и Claude Opus 5, а спорные случаи разбирал Gemini 3.1 Pro. Порог золотой медали — 29 баллов.

    Почему это важно: Cline провёл слепую оценку восьми моделей на задачах IMO 2026 в одном и том же harness и свёл результаты с ценой за попытку — так видно реальную отдачу от моделей с открытыми весами.

25.08вт
  1. Permission Protocol · AI Agent Incident Tracker71

    NVIDIA NemoClaw 暴露的 Ollama 服务被恶意网页持久污染模型

    NVIDIA NemoClaw 配置使 Ollama API 超出默认回环边界可达,恶意网页通过 DNS rebinding 从浏览器上下文访问该本地模型服务,并利用未鉴权的 Ollama API 修改模型 chat template,写入的隐藏指令会在后续对话中持续生效,重新开一个对话也无法清除。

    Ожидает перевода

20.08чт
17.08пн
11.08вт
  1. Sean Goedecke · Blog52

    为什么本地模型不会胜出:批处理与 GPU 效率决定推理成本

    Sean Goedecke 认为本地模型不会成为主流,绝大多数推理仍会发生在 AI 数据中心。他给出的理由是:前沿模型体积远超消费级设备,而数据中心可通过批处理数百名用户的请求摊薄成本,加上 B200 相比 RTX 4090 在同等功耗下约有 3 倍 flops 和近 4 倍内存带宽,本地运行约需多消耗 30 倍资源;家庭推理的电力成本约每月 50 至 300 美元。

    Ожидает перевода

08.07ср
  1. Martin Fowler · Exploring Generative AI71

    在本地小模型上做智能体编码的实测体验

    Martin Fowler 在 M3 Max 48GB 和 M5 Pro 64GB 上实测 Qwen3.6 35B MoE、Gemma 4 31B/26B、Qwen Coder Next 80B 等本地小模型的智能体编码能力,按内存、速度、工具调用、代码正确性、上下文、任务复杂度、代码质量逐层筛选。

    Ожидает перевода

    Почему это важно: 作者用两个具体任务对比多款本地小模型的智能体编码表现,并给出可复用的任务选择标准。

07.07вт
27.06сб
  1. Этихлид48

    从代理网关到本地 Opus:AI 工程面试题深度追问清单

    一份面向 AI 工程岗位的面试题追问清单,覆盖代理网关(如 OpenRouter/LiteLLM)、MCP/CLI、从零手写 Agent、多智能体编码流程、自定义 benchmark 以及本地部署约 27B-Q3_K_M.gguf 模型等方向。作者认为,这些题目的通用版本如今谁都能靠 vibe coding 一晚做出来,已失去简历价值,真正稀缺的是把任务打磨到"理想"状态的能力。

    Ожидает перевода

22.06пн
23.05сб
28.04вт
21.04вт
13.04пн
06.04пн
  1. Martin Alderson62

    算力短缺接下来会怎样:从 GitHub 提交量到 Claude 限流

    Martin Alderson 认为未来 18-24 个月将由算力短缺主导,因为需求呈指数增长而供给只是线性增加。他引用 GitHub COO 的数据称 GitHub 近 3 个月提交量年化增长约 14 倍,并提到 OpenAI Codex 团队负责人 Thibault Sottiaux 表示行业正处于需求超过供给的阶段。

    Ожидает перевода

31.03вт
  1. Paper Compute · Engineering Blog58

    Paper Compute 发布 tapes 与 stereOS,为生产环境运行 AI 智能体提供可观测与隔离基础设施

    Paper Compute 发布面向生产环境 AI 智能体的基础设施,包含 tapes 和 stereOS 两个组件。tapes 是零埋点的可观测层,以反向代理形式部署在智能体与推理服务之间,无需 SDK 或改代码,只需一个环境变量,即可捕获并生成可验证、防篡改的执行记录,并支持异常检测。

    Ожидает перевода

13.03пт
  1. Martin Alderson78

    Как распознавать документы через OCR с помощью моделей серии Qwen 3.5

    Автор прогнал PDF через OCR с помощью открытых мультимодальных моделей серии Qwen 3.5: сначала экспортировал каждую страницу в изображение с разрешением 100 dpi через PyMuPDF, а затем отдал его модели на распознавание. По результатам тестов Qwen3.5-9B — это баланс между качеством и скоростью, а модели поменьше, от 0.8B до 2B, на сложных документах часто сбиваются и начинают пересказывать содержимое.

    Почему это важно: Автор протестировал модели Qwen 3.5 разных размеров на OCR для PDF и описал два воспроизводимых пути — локальный и через OpenRouter — вместе с данными о затратах.

03.03вт
  1. Paper Compute · Engineering Blog36

    别再优化模型了,开始加固运行时:stereOS 为 AI 智能体打造可验证执行底座

    stereOS 是一个基于 Linux 的操作系统,把 AI 编码智能体跑在各自独立的沙箱虚拟机里,每个智能体拥有独立内核、内存和磁盘,与宿主机不共享任何资源。它采用完整虚拟机而非 Firecracker、Cloud Hypervisor 等 microVM,以保留安全启动、GPU 直通和嵌套虚拟化能力,并称热 VM 可在 70ms 内让智能体执行首个有效动作。

    Ожидает перевода

01.03вс
  1. Martin Alderson62

    为什么端侧智能体 AI 短期内难以跟上云端

    作者 Martin Alderson 认为,端侧智能体 AI 在消费级设备上短期内难以实用,瓶颈是内存、KV cache 与推理速度。他指出 3B 模型量化后约需 2GB、7B 约需 5GB,而手机端上下文常被限制在 4K token,仅工具定义就可能占满;即便 32K 上下文,7B Q4 模型的 KV cache 也已超出 iPhone 17 的内存。

    Ожидает перевода

27.02пт