跳转至

Twitter AI Coding - 2026-07-31

1. 人们在讨论什么

1.1 定价、访问和模型治理,汇成了一个落地问题 (🡕)

Twitter/X 上最强的一波 AI 编程讨论,不是某个新演示,而是模型选择背后的落地问题:团队该把工作跑在哪里、哪些模型能在什么入口继续可用、日常智能体任务究竟能便宜到什么程度,以及组织内部该把访问权限给到谁。6 条入选内容支撑了这个主题,原始数据也强化了这一转向:GPT-5.6 的提及量较前一天再次上升,Luna 的提及量大致翻倍,关于 DeepSeek 的帖子也越来越把兼容 Codex 的替代方案讲成可行的路由选项,而不再只是边缘试验。

@OpenAIDevs 表示(449 个点赞,38 条回复,27,118 次浏览,31 次收藏),GPT-5.4 和 GPT-5.4 mini 将于 8 月 31 日从登录态 ChatGPT 界面下线,但仍会通过 OpenAI API 和使用 API key 认证的 Codex 会话提供。回复解释了这为什么重要:几位开发者明确表示,他们真正在意的是 API 和 Codex 这条路径;另一个人则马上追问,停用这两个模型会不会影响额度重置。这与其说是模型“讣告”,不如说是在提醒大家:严肃的编程工作流正在锚定到以 API 和智能体为基础的入口,而不再只依赖面向消费者的聊天界面。

@github 表示(141 个点赞,19 条回复,27,855 次浏览,13 次收藏),GitHub Copilot 内的 GPT-5.6 Luna 现在便宜了 80%,GPT-5.6 Terra 便宜了 20%。回复很快从庆祝转向了工作负载摆放:有人说该把后台任务扔给 Luna,有人说降价对创业公司有帮助,还有人抱怨 40 美元的 Copilot 套餐“2 轮提示就挂了。” 换句话说,标价下降当然重要,但用户已经在用它是否真正改变日常路由和配额体验来衡量价值。

@burkeholland 写道(69 个点赞,10 条回复,4,089 次浏览,9 次收藏),Luna 已成为 Copilot 里最便宜的模型,价格大约是每百万输入 token 0.20 美元、每百万输出 token 1.20 美元。截图把这套经济账讲得更具体:它展示了 Luna 的 328K 上下文窗口,以及 Copilot 对输入、缓存输入和输出的 AI credit 计费。回复里没人质疑降价是不是真的;大家问的是默认智能体会不会路由到 Luna,以及更重的父智能体能不能把常规子任务压到更便宜的子智能体上。

Copilot 的 GPT-5.6 Luna 模型卡,展示 328K 上下文,以及输入、缓存输入和输出 token 更低的 AI credit 成本

@GHchangelog 报道(16 个点赞,1,710 次浏览,4 次收藏),企业团队现在可以在公开预览中定向应用 Copilot 模型策略。链接里的 GitHub 更新日志 说,管理员现在可以在企业级把模型标为 Enabled、Disabled 或 Optional,然后按限制最少的访问规则把可选模型授权给特定团队。这很重要,因为当天的价格和访问变化立刻和基于角色的治理撞到了一起:问题不再只是“哪个模型最好”,而是“财务团队、平台团队或前沿探索团队默认该用哪个模型”。

替代提供商的帖子则从下方施加了压力。@0x_sakata 发帖(21 个点赞,14 条回复,561 次浏览)展示了 OpenRouter 上 DeepSeek V4 Flash 的条目:1M 上下文,直接定价约为每百万输入 token 0.14 美元、输出 0.28 美元;而 @0x_kaize 转发(29 个点赞,11 条回复,2,188 次浏览,5 次收藏)了一张 DeepSeek 的基准测试表,显示 Flash 0731 在多个智能体式指标上高于更早的 Flash 和 Pro 预览版。这些帖子显然带有宣传色彩,但它们的截图依然重要,因为它们公开证明了一点:更便宜、兼容 Codex、兼容 responses API 的后端,正在被直接卖进和 Luna、Terra 同一场路由讨论里。

DeepSeek 的基准测试表,显示 V4 Flash 0731 在多个智能体式编程基准上高于更早的 DeepSeek Flash 和 Pro 预览版本

讨论要点: 官方和非官方帖子下的回复出奇一致。人们并不只是在为便宜模型叫好,而是在问:更便宜的模型会不会成为后台工作的默认选项、限制是否还是来得太早、访问控制能不能跟上不断变化的模型菜单。

与前日对比: 7 月 30 日的重点已经是配额和降价。到了 7 月 31 日,讨论进一步推进到了访问和治理:哪些界面会失去模型、哪些团队能用哪些模型,以及哪些更便宜的提供商现在已经能成为默认路线。

1.2 Antigravity 的存在感保持稳定,但案例变得更落地了 (🡒)

Google Antigravity 依然存在感很强,但最有价值的证据已经从泛泛传播“免费工具”转向更偏落地的构建案例。3 条入选内容支撑了这个主题。在更大的回顾样本里,课程和清单帖继续给这个品牌带来曝光,但最终留下的最强证据来自遥测、硬件和 SDK 封装。

@antigravity 展示(99 个点赞,11 条回复,7,262 次浏览,10 次收藏),Google Developer Experts 在 Sonoma Raceway 打造了 AI Race Coach,把车辆遥测和软件编排连到了一起。链接里的 Google 开发者文章 把技术栈写得异常具体:Python 负责从接入车辆的 Pixel 10 采集遥测数据,Jetpack Compose 驱动驾驶舱仪表盘,Gemma 4 在本地运行以提供低延迟提醒,Gemini API 则在云端负责更深层的车手建模。这让 Antigravity 的定位从“智能体 IDE”式营销,走向一个对信任敏感、边缘端加云端协同、且失败代价明确的系统。

@googledevs 分享(22 个点赞,2 条回复,5,022 次浏览,4 次收藏)了 Glanceboard,这是一个开源电子墨水相框,使用 Gemini 3.6 Flash 和 Nano Banana,把日历、天气和家庭角色变成每日插图。仓库 README 说,这个项目运行在本地 FastAPI 服务器上,使用现成硬件,并在构建过程中用到 Antigravity,而不是把 Antigravity 本身当成产品。这是一个很有价值的定位变化:Antigravity 开始以“开发者用来把东西做出来的工具”出现,而不只是被演示的那个东西。

Glanceboard 电子墨水显示屏,展示根据日历和天气数据生成的每日插画式计划板

@glaforge 发布了(18 个点赞,2 条回复,788 次浏览,5 次收藏)一个非官方的 Antigravity Java SDK。公告和链接的仓库都写到:它是底层 Go 二进制的 Java 封装,支持自定义工具和响应式流,并明确瞄准企业 Java 应用、CI/CD 机器人以及内部 CLI 工具。这很重要,因为它把 Antigravity 扩展到了许多企业团队本来就长期驻留的运行时和语言地带。

非官方 Antigravity Java SDK 的示意图,展示围绕 Go 二进制的 Java 封装、自定义工具、流式支持,以及企业 Java 用例

讨论要点: AI Race Coach 讨论串下的回复不是泛泛夸赞。人们在问更难的基准赛道和传感器同步问题,这说明读者评估的是落地深度,而不只是被 Google 品牌吸引。

与前日对比: 与 7 月 30 日相比,Antigravity 的原始曝光量大致持平。变化在于质量:少了一些“看这个工具包”,多了一些“这是遥测栈、硬件回路或企业 SDK”。

1.3 技能、记忆与可复用上下文封装,正在变成一层产品 (🡕)

当天最清晰的构建者模式,是把上下文外置成可复用的层:长文技能、领域技能包、记忆引擎、共享记忆的 MCP 服务器,以及可视化技能管理器。6 条入选内容支撑了这个主题,底层数据也和它同步变化:与 7 月 30 日相比,“memory”的提及量明显上升,MCP 和 skills 的提及量也在增长。

@Argona0x 重点介绍(24 个点赞,6 条回复,969 次浏览,21 次收藏)了 book-to-skill,它把一本书或一组文档语料变成可安装的智能体技能,而不是逼人反复翻 PDF 或粗暴地把内容塞进上下文。推文配图和 README 基本一致:生成的产物包括 SKILL.md、章节文件、术语表、模式条目和速查表;README 还声称,针对特定问题时,这种方式比把整本书直接塞进上下文少用 24 倍到 51 倍 token。最有价值的一条回复没有追问更多存储,而是说真正的升级在于:知识能在需要的时候立刻拿来用。另一条回复还指出,新版本已经会扫描传入技能中的提示词注入。

book-to-skill 的工作流图,展示一次性把文档编译成 SKILL.md、章节文件、术语表、模式和低 token 成本的运行时检索

@tom_doerr 分享(11 个点赞,2 条回复,2,698 次浏览,16 次收藏)了 Supabase Agent Skills,其 README 说这个包适配 18+ 个智能体,包含一个通用 Supabase 技能和一个 Postgres 最佳实践技能。@Scallop_io 发布(22 个点赞,9 条回复,2,752 次浏览)了 Scallop Skills,包含 22 个协议技能、3 个专家智能体、经过验证的 TypeScript 和 Python 示例,并支持 Claude Code、Codex CLI、Cursor、GitHub Copilot 和 Windsurf。两者的模式一致:把领域知识编码一次,然后让它随着团队实际使用的编程智能体到处可移植。

Scallop Skills 发布配图,列出 22 个协议技能、3 个专家智能体、经过验证的 TypeScript 和 Python 示例,以及对多种编程智能体的支持

另外两条不同的记忆层也在往上层移动。@QCXINT_ 重点介绍(8 个点赞,3 条回复,179 次浏览,4 次收藏)了 agentmemory,强调本地运行、混合检索、53 个 MCP 工具,以及广泛的跨智能体支持。@DhravyaShah 介绍(23 个点赞,3 条回复,4 次引用,1,426 次浏览,5 次收藏)了新的 Supermemory MCP,其文档把它定位为一层共享记忆,提供 memoryrecallwhoAmI 工具、OAuth 认证以及按项目划分的上下文。两者的说法不同:一个主打“本地优先的持久记忆引擎”,另一个主打“跨工具和团队共享上下文”;但它们解决的是同一个元问题:编程智能体依然足够无状态,以至于人们开始把记忆当作基础设施来购买或自建。

agentmemory 仓库截图,突出面向编程智能体的持久记忆、95.2% 检索率、92% 的 token 降低,以及广泛的跨智能体兼容性

@tom_doerr 分享(2 个点赞,832 次浏览,3 次收藏)了 SkillsGate,这是一个桌面应用和终端 UI,可在 20+ 个智能体之间浏览、安装、编辑和同步技能。连技能管理器本身都开始成为产品,这件事很说明问题:可复用指令的目录已经大到“把 markdown 复制进正确文件夹”这种做法不再能扩展。

讨论要点: 回复和文档在一点上高度一致:问题不只是缺少上下文,而是缺少一种可移植、可信、检索成本低,而且能在团队下一次换界面时继续可用的上下文。

与前日对比: 7 月 30 日已经出现了公开的技能包和智能体定制。到了 7 月 31 日,这一层变得更明确:记忆服务器、可视化技能管理,以及把文档编译成技能,都开始作为独立产品出现。

1.4 提示词循环之上的工作层还在继续变厚 (🡕)

另一个强主题是,开发者持续在单轮提示词循环之上构建编排层。4 条入选内容支撑了它:感知分支的会话链、工作界面内定制生成的工具、把常见智能体管线打包在一起的开源运行框架,以及围绕房间而不是单一操作者构建的多人运行框架。

@kdaigle 指出(42 个点赞,1 条回复,7,089 次浏览,16 次收藏),GitHub 的 stacked sessions 和 stacked pull requests 工作流。链接里的 GitHub 博文 很重要,因为它公开展示了:一次失败的单次现代化改造,是如何在 dev 分支上被重新拆成一串相互依赖的会话和 PR。现在的卖点已经不再是“一个完美提示词”,而是分支编排、增量审查,以及保留足够上下文,让大改动依然能被合并。

GitHub Copilot 的 stacked sessions 视图,展示一个仓库级的会话与 pull request 关联链,用于前端现代化工作

@burkeholland 展示(143 个点赞,14 条回复,8,522 次浏览,33 次收藏),他在 GitHub Copilot 应用里要了一个 SQLite 编辑器,结果拿到了一个“带 Intellisense 的”。回复立刻从惊叹转向生命周期问题:接下来怎么处理这个生成出来的工具?它如何在多次运行之间持久化或复用?一旦一次性工具合成开始能跑通,这正是下一层要回答的问题。

@DamiDefi 重点介绍(65 个点赞,2 条回复,3,504 次浏览,4 次收藏)了 Deep Agents,其 README 把它描述为一个与模型无关的运行框架,带有子智能体、文件系统访问、上下文管理、命令行执行、持久记忆以及人工介入控制。@omarsar0 指出(15 个点赞,8 条回复,2,933 次浏览,11 次收藏)了 YC 的 QM,其 README 则把工作单元重构为人、房间或项目,并配上有作用域的记忆、文件、权限、cron 任务,以及跨 Slack 和 Web 的共享技能。两者都说明,如今产品已不只是模型本身,而是围绕模型的持久化运行环境。

@perplexitydevs 宣布(9 个点赞,2 条回复,258 次浏览,5 次收藏)推出一个远程 MCP 服务器,通过 API key 工作,本地无需安装任何东西。这是同一转向下一个更安静但重要的信号:越来越多有用的能力面,正在变成智能体可以按需调用的可插拔服务端点。

讨论要点: Burke 和 QM 下最好的回复,关注的都是持久化、文件编辑权限和交接状态。眼下真正的问题已经不是智能体能不能产出结果,而是多少个界面、会话、房间和子智能体,能围绕这些结果安全地共享状态。

与前日对比: 7 月 30 日已经强调了 stacked sessions 和分支感知工作流。7 月 31 日则更进一步,开始突出多人运行框架、生成式定制工具,以及远程工具端点。


2. 令人困扰的问题

如果运行框架或积分机制不对,便宜模型也帮不上忙

严重程度:高。当天的降价是真实的,但围绕降价的讨论也说明了:如果运行框架、路由逻辑和额度计费本身不合理,更便宜的前沿模型依然解决不了太多问题。@github 表示(141 个点赞,19 条回复,27,855 次浏览,13 次收藏),Copilot 里的 Luna 和 Terra 更便宜了,但回复立刻分成两派:一派说“拿 Luna 跑后台任务”,另一派说“我付费的套餐还是太快用完”。@burkeholland 写道(69 个点赞,10 条回复,4,089 次浏览,9 次收藏),Luna 已成 Copilot 里最便宜的模型,而回复里的下一个问题就是:默认智能体和子智能体到底会不会真的路由过去。

同样的挫败感也出现在基准测试这一侧。@Hesamation 认为(10 个点赞,4 条回复,1,205 次浏览,1 次收藏),在一组引用的 28 任务运行框架测试里,Claude Code 明显比 Kimi Code 贵得多;图表把抱怨具体化了:Kimi Code 为 61K token、0.22 美元,Hermes 为 67K、0.28 美元,而 Claude Code 在结果相近的情况下用了 340K+ token、成本超过 2.00 美元。@0x_sakata 发帖(21 个点赞,14 条回复,561 次浏览),也是出于同样原因,给出了通过 OpenRouter 使用更便宜的 DeepSeek V4 Flash 路径:人们现在主动比较的已不是单纯的模型质量,而是更划算的路由经济性。

人们的应对方式,是把常规工作压给 Luna、更激进地比较不同运行框架,以及测试更便宜、兼容 Codex 的后端。这值得去构建,因为问题已经从头条式的模型定价,转向了工作负载塑形、默认路由和透明的预算控制。

反复重讲上下文的成本,仍高到足以催生一整层产品

严重程度:高。当天最干净的挫败信号,不是一条抱怨推文,而是为了避免一次又一次重述上下文而冒出来的产品数量。@Argona0x 重点介绍(24 个点赞,6 条回复,969 次浏览,21 次收藏)了 book-to-skill,因为一旦章节级知识被困在 PDF 里,而不是进入智能体可用的上下文,技术书在实践里就会变得毫无用处。@QCXINT_ 重点介绍(8 个点赞,3 条回复,179 次浏览,4 次收藏)了 agentmemory,直接打出“别再重复解释了”的卖点;@DhravyaShah 介绍(23 个点赞,3 条回复,4 次引用,1,426 次浏览,5 次收藏)了 Supermemory MCP,则把它定位为跨 Claude、Cursor、Codex 和 OpenCode 的共享上下文。

领域技能包是在用另一个角度解决同样的问题。@tom_doerr 分享(11 个点赞,2 条回复,2,698 次浏览,16 次收藏)了 Supabase Agent Skills,而 @Scallop_io 发布(22 个点赞,9 条回复,2,752 次浏览)了 Scallop Skills。两者都在假设:与其让团队在每个界面上重新解释领域知识,不如把这些知识装进可安装的包里,到处复用。

人们的应对方式,是把文档编译成技能、加装记忆服务器,或者安装领域技能包和技能管理器。这值得去构建,因为这种挫败既实际又反复出现,尽管这条赛道也已经开始挤满彼此重叠的做法。

信任、权限和账号底层机制仍落后于能力发展

严重程度:中高。随着智能体获得更多仓库上下文和更多共享界面,人们不断撞上同一个问题:到底什么该被信任,谁又该被允许做什么。@sunglasses_dev 警告(1 个点赞,2 条回复,20 次浏览),GitHub Copilot code review 即使加载了仓库里的 SKILL.md 文件和 MCP 上下文,也不代表这些输入默认可信。链接的 Sunglasses 文章 解释了 AGENTS.mdCLAUDE.mdSKILL.md.cursor/rules.github/copilot-instructions.md 如何都可能夹带恶意的报告压制或凭证转移指令,同时看起来又像普通的仓库指南。

安全示意图,显示即便是只读仓库指令和 MCP 结果,在送入 Copilot code review 前也仍需做输入可信度检查

同样的担忧也出现在工作流产品里。@GHchangelog 报道(16 个点赞,1,710 次浏览,4 次收藏),Copilot 新增了团队级模型策略;而在 @omarsar0 提到(15 个点赞,8 条回复,2,933 次浏览,11 次收藏)QM 的回复里,人们问得非常具体:当多个智能体共享同一个 Slack 频道时,谁有权编辑文件,这个权限又如何绑定到某个分支或作用域?就连基础账号状态也依然脆弱。@awakecoding 报告(1 个点赞,2 条回复,313 次浏览),自己有 20 分钟都无法工作,因为 Copilot 应用以为它已退出登录,而健康检查却显示授权正常。

人们的应对方式,是收紧权限、把仓库指令视为不可信输入,并在模型和共享房间之外再加更明确的策略层。这值得去构建,因为信任边界如今已成为更丰富的智能体工作流能否被安全采用的主要约束之一。


3. 人们期望的功能

低成本子智能体路由,以及清晰的积分规则

这是当天最明确的实际需求。官方降价只有在智能体运行时真能把常规工作推到更便宜的通道,并解释额度是如何被消耗时,才算真正发挥价值。@github 表示(141 个点赞,19 条回复,27,855 次浏览,13 次收藏),Copilot 里的 Luna 和 Terra 更便宜了,但回复立刻跳到了后台任务路由和套餐耗尽。@burkeholland 写道(69 个点赞,10 条回复,4,089 次浏览,9 次收藏),Luna 现在是 Copilot 最便宜的模型,而回复立刻追问默认智能体会不会使用它。@OpenAIDevs 表示(449 个点赞,38 条回复,27,118 次浏览,31 次收藏),GPT-5.4 和 GPT-5.4 mini 即便离开 ChatGPT,也会留在 API 和 Codex 上,而最早的追问之一就是额度问题。这不是一个“未来也许需要”的愿景,而是一个直接需求:更低成本的模型已经存在,但用户仍然缺少足够的运行时控制和预算透明度,无法干净地把它们用起来。机会:直接机会。

能跨工具跟着工作走的可移植知识与记忆

第二个需求同样非常实际:人们想要一种能跨会话、跨工具、跨同事存活的上下文,而不是在每次对话里重新粘贴一遍。@Argona0x 重点介绍(24 个点赞,6 条回复,969 次浏览,21 次收藏)了 book-to-skill,因为长篇技术知识否则就会被困在 PDF 里;@QCXINT_ 重点介绍(8 个点赞,3 条回复,179 次浏览,4 次收藏)了 agentmemory,把它做成本地的跨智能体记忆引擎;@DhravyaShah 介绍(23 个点赞,3 条回复,4 次引用,1,426 次浏览,5 次收藏)了 Supermemory MCP,则主打带团队权限的共享上下文。情绪层面也看得见:人们已经厌倦一遍遍重复自己,也厌倦有价值的过往工作被丢掉。但这里更主导的信号是运营层面的,因为这一簇里每个入选项目都承诺了更少浪费的 token、更少重复解释,或者更可靠地复用先前决策。机会:竞争性机会。

面向智能体上下文、带信任评分的指令与权限系统

随着仓库指令、MCP 资源和共享房间变成常态,人们想听到一个更强的答案:智能体到底该信什么?@sunglasses_dev 警告(1 个点赞,2 条回复,20 次浏览),只读仓库指令和 MCP 结果并不会自动可信,链接文章也展示了指令文件如何把压制输出或转移凭证的指令伪装进看似正常的指导里。@GHchangelog 报道(16 个点赞,1,710 次浏览,4 次收藏),新增了团队级模型策略定向;而在 @omarsar0 提到(15 个点赞,8 条回复,2,933 次浏览,11 次收藏)QM 的回复下,人们立刻追问共享频道里的编辑权限如何划分。这是一个紧迫度很高的实际需求,因为更复杂的工作流已经先出现了,但可信来源和权限模型仍然很零散。机会:直接机会。

面向技能、记忆和远程工具的一键发现与安装

另一个更安静但同样重要的需求,是这些新层应该足够容易采用。@perplexitydevs 宣布(9 个点赞,2 条回复,258 次浏览,5 次收藏)推出一个远程 MCP 服务器,除了 API key 之外本地无需安装任何东西;@tom_doerr 分享(2 个点赞,832 次浏览,3 次收藏)了 SkillsGate,把它做成跨 20+ 个智能体的可视化与终端技能管理器。@Scallop_io 发布(22 个点赞,9 条回复,2,752 次浏览)了一个带明确安装界面的领域技能包,而 @tom_doerr 分享(11 个点赞,2 条回复,2,698 次浏览,16 次收藏)Supabase Agent Skills 时也给出了标准安装路径。这是很实际的需求,但比空白地带更像竞争赛道:已经有多支团队意识到,部署摩擦本身就是产品机会。机会:竞争性机会。


4. 使用中的工具与方法

工具 类别 评价 优势 局限
GitHub Copilot 中的 GPT-5.6 Luna / Terra LLM (+/-) Copilot 内标价大幅下降,Luna 上下文窗口大,适合常规和后台工作 回复里仍有人抱怨套餐很快耗尽,也不清楚默认是否会路由到更便宜的模型
通过 API 和 Codex 使用的 GPT-5.4 / GPT-5.4 mini LLM/API (+/-) 即便从 ChatGPT 下线,仍可用于 API 驱动和 Codex 工作流 离开登录态 ChatGPT 界面后,访问路径和额度是否变化仍让人不确定
通过 OpenRouter 使用的 DeepSeek V4 Flash LLM/API (+/-) 标价很低,1M 上下文,厂商也把它宣传为兼容 Codex 和 responses API 今天的证据主要来自厂商和分销截图,而非广泛的独立验证
GitHub Copilot 应用与 stacked sessions 编程智能体界面 (+/-) 支持 stacked session 链、stacked PR,以及应用内的一次性工具合成 一则报告暴露出认证状态脆弱,用户也还在追问生成工具如何持久化,以及智能体实际使用哪些模型
Google Antigravity 智能体工作空间 (+) 已用于覆盖遥测、硬件、本地模型、云模型和新 SDK 封装的落地构建 公开证据仍集中在展示型项目,而非广泛的生产复盘
book-to-skill 知识封装 (+) 把书籍和文档语料转成可复用技能,降低运行时 token 负担 今天的验证主要来自仓库自述和早期用户回复,还没有广泛采用数据
Supabase Agent Skills / Scallop Skills 领域技能包 (+) 可复用的领域指导、已验证示例、跨多种智能体兼容 市场正分裂到许多智能体界面和安装路径中
Supermemory MCP 记忆 / MCP (+/-) 跨工具共享上下文,支持 OAuth、项目作用域,以及简单的记忆与召回原语 回复里立刻追问后端架构和实际运行形态
agentmemory 本地记忆引擎 (+) 本地优先存储、混合检索、工具丰富、跨智能体支持广 说法很强,但讨论量仍然不大
SkillsGate 技能管理器 (+) 可通过桌面和 TUI 界面在 20+ 个智能体间浏览、安装、编辑和同步技能 还只是早期信号,今天关于公开使用情况的讨论很少
Deep Agents 编排框架 (+) 打包了子智能体、文件系统、命令行、记忆与人工在环控制 目前更多还是框架层证据,而不是操作者故事
QM 多人智能体运行框架 (+/-) 共享房间、有作用域的记忆、权限、文件、cron 任务,以及不绑定厂商的智能体使用 回复立刻聚焦共享空间里的权限范围和编辑权
Perplexity 远程 MCP 服务器 远程工具端点 (+) 通过 API key 访问、本地无需安装,降低部署摩擦 今天的公开证据还仅限于公告和文档,而非使用报告

整体满意度光谱大致从“有用但运维细节仍很模糊”延伸到“有前景的一层,但还需要信任和工作流打磨”。人们显然愿意混用多种界面:用 Copilot 里的前沿模型做主力编码,用 OpenRouter 一类更便宜的后端处理成本敏感工作,把文档编译成技能来沉淀长期知识,再用记忆层或 MCP 层把上下文带过不同工具。最明显的迁移模式,不是一个模型取代另一个模型,而是团队试图把重复性或后台工作迁到更便宜的模型上,同时把昂贵模型留给更难的推理任务。因此,竞争压力同时来自三个方向:更便宜的模型路由、更好的上下文封装,以及围绕模型的更低摩擦编排。


5. 人们在构建什么

项目 构建者 功能 解决的问题 技术栈 阶段 链接
AI Race Coach @antigravity 展示的 Google Developer Experts 把赛车遥测数据转成给车手的指导反馈 弥合赛车专业知识、传感器数据流与 AI 辅助之间的领域鸿沟 Antigravity、Python、Pixel 10 遥测采集、Gemma 4、Gemini API、Jetpack Compose Alpha 帖子, 博客
Glanceboard @googledevs 分享的 Google Gemini 团队 把日历和天气转成家庭计划插图的电子墨水相框 让家庭规划融入环境,而不是变成又一个应用标签页 FastAPI、Gemini 3.6 Flash、Nano Banana、电子墨水硬件 Beta 帖子, 仓库
Antigravity Java SDK @glaforge 供 JVM 应用使用 Antigravity 的 Java 封装 让企业 Java 团队不用切换运行时也能采用 Antigravity Java、Antigravity Go 二进制、自定义工具、响应式流 Alpha 帖子, 仓库
book-to-skill @Argona0x 分享 把书籍和长文档编译成可安装的智能体技能 避免反复把长篇参考资料塞进上下文窗口 结构化 Markdown 技能、章节拆分、术语表和模式提取 Beta 帖子, 仓库
Supabase Agent Skills @tom_doerr 分享 面向编程智能体的官方 Supabase 与 Postgres 技能包 在多种智能体界面之间复用数据库和平台经验 Markdown 技能包、Supabase 指南、Postgres 最佳实践 Beta 帖子, 仓库
idea-validation-agents @tom_doerr 分享 用于创意生成、验证、市场深挖和转向的 AI 创业分析工作流 在投入工程时间前帮助开发者验证需求 Claude Code、OpenAI Codex、Cursor、持久记忆文件夹 Beta 帖子, 仓库
Scallop Skills @Scallop_io 带专家智能体和验证语言示例的协议技能包 为团队在不同编程智能体间提供可复用的链上与协议指导 技能包、TypeScript 示例、Python 示例、多智能体支持 Beta 帖子
Deep Agents @DamiDefi 分享 具备子智能体、记忆、命令行访问和人工审查钩子的开放智能体框架 帮团队省掉重建标准智能体运行时部件的成本 LangChain、子智能体、文件系统、命令行、持久记忆 Beta 帖子, 仓库
QM @omarsar0 提到的 YC Software 围绕房间、文件、权限和 cron 组织的多人 AI 工作空间 支持协作式智能体工作,而不是孤立的单人聊天 Slack、Web 应用、有作用域的记忆、文件、权限、cron 任务 Beta 帖子, 仓库
agentmemory @QCXINT_ 分享 面向多种编程智能体的持久化本地记忆层 让用户不用反复解释上下文,也不丢掉先前决策 本地记忆引擎、混合检索、MCP 工具 Beta 帖子, 仓库
SkillsGate @tom_doerr 分享 用于浏览和同步技能的桌面应用与 TUI 随着技能生态碎片化,降低部署摩擦 桌面应用、终端 UI、技能发现与同步 Beta 帖子, 仓库
Supermemory MCP @DhravyaShah 面向多种智能体工具的共享记忆服务器 让项目和团队上下文在不同编程界面间可移植 MCP、OAuth、按项目划分的记忆与召回工具 Beta 帖子, 文档

当天最有辨识度的项目是 AI Race Coach,因为它把智能体工具链接到了一个硬现实闭环:本地车辆遥测、端侧与云侧模型,以及实时车手反馈。Glanceboard 则指向完全不同的方向,说明 Antigravity 周边工作也在走进家庭环境软件,而不是继续困在编程演示里。

重复度最高的构建模式,是把专业知识封装成可复用资产。book-to-skill、Supabase Agent Skills、Scallop Skills、SkillsGate 和 Supermemory 都在假设:有用的智能体行为应该是可安装、可迁移、可检索的,而不是每次会话都从零重写。idea-validation-agents 则把同样的模式从技术知识延伸到了构建前的市场判断。

第二个反复出现的模式,是围绕智能体搭建运行底座。Deep Agents、QM 和 agentmemory 分别处理这层底座的不同部分:编排、协作工作空间结构和持久记忆。同一天有多位彼此独立的开发者在做这些层,是一个强信号:真正的限制因素已经不再只是原始生成能力。


6. 新动态与亮点

GPT-5.4 和 GPT-5.4 mini 正在离开 ChatGPT,但不会离开开发者工作流

@OpenAIDevs 表示(449 个点赞,38 条回复,27,118 次浏览,31 次收藏),这两个模型将于 8 月 31 日离开登录态 ChatGPT 界面,但仍可通过 OpenAI API 以及使用 API key 的 Codex 会话使用。这很重要,因为回复显示,开发者第一时间是从工作流连续性的角度解读这个变化,而不是从消费者访问角度:大家真正关心的是编程路径和额度是否还能保持不变。

GitHub 新增了企业团队级的模型策略定向

@GHchangelog 报道(16 个点赞,1,710 次浏览,4 次收藏),企业团队现在可以通过定向策略获得可选的 Copilot 模型。链接里的更新日志说,管理员可以把模型标记为 Enabled、Disabled 或 Optional,再以限制最少的访问方式授予指定团队。这很值得注意,因为它把模型选择变成了一个管理员界面,而不再只是终端用户偏好。

Perplexity 把 MCP 接入推向远程服务模式

@perplexitydevs 宣布(9 个点赞,2 条回复,258 次浏览,5 次收藏)推出一个远程 MCP 服务器,通过 API key 工作,本地无需安装任何东西。文档把这个承诺写得很明确。这很值得注意,因为就在更多团队开始试验基于 MCP 的工作流时,它把工具连接的部署门槛往下拉了一截。

一次明显的 Copilot 认证状态错配暴露了可靠性缺口

@awakecoding 报告(1 个点赞,2 条回复,313 次浏览),GitHub Copilot 应用有 20 分钟都以为自己处于退出登录状态,即使它自己的健康检查同时显示授权良好。这只是一个样本很小的事件,但它依然值得注意,因为它抓住了一个很具体的故障模式:一个本来正被当作更复杂智能体工作流中心来宣传的界面,连基础状态都可能出错。

指令文件投毒成了被明确命名的信任问题

@sunglasses_dev 警告(1 个点赞,2 条回复,20 次浏览),仓库指令文件和 MCP 上下文,不该仅因为它们被加载进只读审查流程就被信任。链接的分析文章具体演示了 AGENTS.mdCLAUDE.md.github/copilot-instructions.md 这类看似正常的文件,如何嵌入敌意指令。这很值得注意,因为它为当天更广泛的信任与权限讨论,补上了一个具体的攻击模型。


7. 机会在哪里

[+++] 面向编程智能体的预算感知路由与配额控制 — 多个部分都给出了证据:GitHub 对 Luna 和 Terra 的降价,Burke Holland 的费率截图,OpenAI 在 API 与 ChatGPT 界面之间拆分模型可用面,以及 Kimi 与 Claude 的成本对比,都指向同一个缺口。团队需要一种运行时,能把子任务路由到更便宜的通道,用直白语言解释支出,并把昂贵模型留给真正困难的部分。

[+++] 可信的可复用上下文层 — book-to-skill、Supabase Agent Skills、Scallop Skills、Supermemory MCP、agentmemory 和 SkillsGate 之所以存在,是因为持久知识仍然太脆弱、太昂贵,没法反复重建。最强的机会不是抽象的“记忆”,而是可移植、检索便宜、安装容易、且安全性可以验证的上下文。

[++] 面向共享智能体工作的策略、权限与来源可追溯性 — 团队级模型定向、QM 的权限追问、Copilot 的认证错配,以及 Sunglasses 对指令文件投毒的分析,都说明更丰富的工作流已经跑在控制平面前面。这里存在一个中等但紧迫的机会:让模型访问、文件权限、指令可信度和可审计性,对管理员和操作者都变得清晰可见。

[++] 远程工具与技能分发基础设施 — Perplexity 的远程 MCP 服务器和 SkillsGate 的跨智能体安装器指向同一个开口:这个生态现在需要一种能跨多种智能体界面轻松发现、安装、更新和撤销工具与技能的机制。之所以是中等机会,是因为已经有多支团队看到了它,但用户需求非常具体。

[+] 在 IDE 之外证明价值的垂直智能体套件 — AI Race Coach、Glanceboard 和 idea-validation-agents 说明,最让人记住的项目不是通用编程演示,而是拥有清晰工作流、产物和终端用户的垂直套件。这是一个正在冒头的机会:模式已经能看见,但今天的例子还很早期,也很异质。


8. 要点总结

  1. 便宜模型把讨论重点从能力转向了路由和治理。 GitHub 对 Luna 和 Terra 的降价,立刻引出了关于后台任务路由、套餐耗尽和团队模型访问的问题,而不是单纯对原始智能力的兴奋。 (来源 1, 来源 2, 来源 3)
  2. 开发者工作连续性,现在比面向消费者界面的连续性更重要。 OpenAI 关于 GPT-5.4 和 GPT-5.4 mini 的公告之所以重要,主要是因为这两个模型还留在 API 和 Codex 里,而这正是回复里开发者最想保住的路径。 (来源)
  3. 可复用上下文正在变成独立的产品层。 当天最强的一簇构建,不是新的模型外壳,而是把文档转成技能、封装领域指导,或把记忆带过不同工具。 (来源 1, 来源 2, 来源 3)
  4. 提示词循环之上的智能体界面正在明显变厚。 stacked sessions、多人协作房间、生成式内部工具和远程 MCP 端点,都指向同一个未来:真正有用的产品,是围绕模型的工作空间,而不只是一次模型调用。 (来源 1, 来源 2, 来源 3)
  5. 信任和可靠性正在变成第一顺位的采用阻碍。 公开的指令文件投毒文章和 Copilot 认证状态错配报告都说明,更丰富的智能体工作流现在卡住的,不只是模型质量,还有来源和底层机制。 (来源 1, 来源 2)