Twitter AI 编程 - 2026-09-18¶
1. 人们在讨论什么¶
1.1 使用可见性、配额绕过和记忆控制仍处于日常实践的核心(🡕)¶
当天最密集的讨论焦点不是新模型发布,而是一个实际操作问题:当编码代理的会话持续变长后,它究竟如何核算使用量、记忆和计费。codex 的提及量维持在 47,与 9 月 17 日持平;memory / compaction / context 的提及量则从 19 降至 14。更有力的证据集中在一批高互动帖子上,主题包括使用分析、压缩策略、项目记忆缺失和套餐异常。
@OpenAIDevs 宣布(495 个赞、79 条回复、60,791 次浏览、140 次收藏)称,Codex 现在可以展示使用量在任务、子代理和单个聊天之间的分布。最有价值的回复并未把这视为问题的终点,而是立即追问:分析功能能否揭示每个例行流程的模式?什么样的子代理开销算浪费,什么样才算健康?这表明,用户现在要的不只是额度限制,还包括运行层面的遥测数据。
@theo 认为(371 个赞、50 条回复、39,432 次浏览、170 次收藏)称,Jev 式逐行压缩并不适合编码代理,因为它会丢失工具结果的上下文、破坏缓存复用效率,也无法保留前沿 API 中隐藏的推理轨迹。回复讨论之所以重要,是因为它把产品抱怨转化成了技术争论:压缩究竟可以删掉什么?工具调用之间是否还能保持有意义的关联?代理表面上的智能,有多少其实依赖于保留完整的工作历史?
@thtbee_ 阐述(224 个赞、16 条回复、19,719 次浏览、28 次收藏)列出了一份 Gemini 4 Pro 和 Antigravity 的愿望清单,但实质上是一份项目记忆愿望清单:私有项目空间、可检查的记忆、恢复跨聊天记忆,以及桌面端本地文件访问。另一则第一手抱怨来自 @RileyRalmuto,后者 发布(19 个赞、4 条回复、2,428 次浏览)展示了一张 Codex 账单页面截图,其中 9 月 4 日的一笔 ChatGPT Pro 20x 付款被标记为 Void;回复称 OpenAI 当天出现了问题,并发放了储备重置额度。

一则可信度较低的绕过限制消息也在流传。@grokkedd 分享(26 个赞、7 条回复、387 次浏览、18 次收藏)分享了一张已删除的 r/codex 帖子截图。该帖声称,在 Codex 限额耗尽后,OpenAI Prism 仍可使用 GPT-6 Astra Extra High。由于证据间接且原帖已被删除,最好将其视为一个信号:人们正在积极寻找替代使用池,而不是把它当成已确认的产品政策。

讨论洞察: 官方可观测性功能已经上线,但回复清楚表明,一旦代理会话变得复杂,用户仍然觉得自己无法预测成本、理解记忆为何丢失,也无法信任计费界面。
与前一天的比较: 9 月 17 日的核心已经是上下文压缩和套餐耗尽。9 月 18 日新增了官方使用分析界面、具体的付款异常截图,以及替代 Astra 访问途径的传闻,因此讨论从对限额的焦虑转向了对实际开销的核算和绕过方案的寻找。
1.2 安全问题从背景担忧转向具体的漏洞利用链分析(🡕)¶
安全讨论迅速从边缘话题上升为首要主题。与漏洞利用或漏洞相关的提及量从 9 月 17 日的 2 条大幅增至 15 条;最受关注的帖子也不再是推测性的警告,而是公开的漏洞利用链、补丁状态讨论,以及对代理连接系统如何失效的分步解释。
@justanotherlaw 放大传播(346 个赞、7 条回复、33,899 次浏览、187 次收藏)转述了《华尔街日报》的报道:“三个拥有 Claude 和 Codex 订阅的人”获取了 OpenAI 身份验证令牌以及对 openai/openai 的写入权限。回复很快追问,这究竟是模型问题,还是单纯的运维安全薄弱,从而推动这一事件从安全圈 Twitter 进入主流编码代理讨论。
@IntCyberDigest 报道(377 个赞、24 条回复、22,016 次浏览、138 次收藏)补充了更完整的攻击链:一张经过恶意构造的 HEIF 图片上传命中了 OpenAI Discourse 论坛中一条过时的 libheif 路径;随后,OpenAI SSO 漏洞将这一立足点升级为对员工 ChatGPT 和 Codex 账户的访问,最终对内部仓库提交了一次无害的 pull request。回复补充了两点重要背景:OpenAI 当天就修复了问题,并支付了 6,500 美元漏洞赏金;研究人员是在人工主导的漏洞利用流程中将 Claude 作为工具使用,而不是让它充当自主攻击者。

@The_Cyber_News 总结(13 个赞、1,547 次浏览)提到了另一项 Plugin4Shell 披露;其链接 Air Security 分析文章 称,该漏洞是 Claude Code、Codex、Copilot 和 Gemini CLI 插件安装器中的 SHA 固定绕过漏洞。关键的运维细节在于:如果检出过程从未验证工作树最终是否确实落在经过审查的提交上,已安装插件就可能自动更新为恶意代码,使攻击变成零点击攻击。Air 表示,Claude Code 2.1.179 和 Codex 0.146.0 已修复;Gemini CLI 因已弃用不会修复;截至披露时,Copilot 尚无已发布的修复版本。

讨论洞察: 回复一再反对“是模型黑进了 OpenAI”这种草率表述。人们真正讨论的是:当编码代理与插件、关联账户、内部仓库和 SSO 系统并存时,会形成怎样的攻击面。
与前一天的比较: 9 月 17 日聚焦预算、密钥处理和自审。9 月 18 日则升级为具体的漏洞利用链、供应商版本号和直接的补丁指导。
1.3 编排框架研究和设备执行变得更加具体(🡕)¶
最受关注的研究帖子讨论的是如何构建代理工作流,而不是如何切换基础模型。antigravity 的提及量从 9 月 17 日的 24 条小幅降至 23 条,但相关内容进一步深入到明确命名的编排框架机制、共享记忆研究和真实设备执行闭环。
@mirrokni 分享(77 个赞、3 条回复、4,272 次浏览、40 次收藏)介绍了 Stellar Colosseum 论文:一种多代理工作流,包含策略探索、就绪门控、证明分解、分段求解和全局验证。该论文声称在 TCS-Bench 上达到 71.0%,Codeforces 得分达到 4,263,并已融入 Antigravity Teamwork 的 “Long Proof” 模式,因此既是研究证据,也是产品迁移信号。
@omarsar0 重点介绍(19 个赞、4 条回复、1,301 次浏览、33 次收藏)介绍了 NVIDIA 的 SoL-Pi 发布 及其论文(arXiv)。论文列出了四项保留的效率机制:Action Fusion、Online Context Compact、ObservationPack 和 Evidence-Preserving Reducer。附带页面的重要性在于,它直接展示了声称的 EdgeBench 结果:在 GPT-5.6 Sol 和 Opus 5 上,令牌流量降低 44.7%-49.0%,API 成本降低约三分之一,同时保持接近基线编排框架的表现。

@alex_verem 曝出(2 个赞、2 条回复、524 次浏览、2 次收藏)介绍了 NVIDIA 的 Agora 论文,其摘要将 Git 本身描述为集体自动研究的共享记忆。截图之所以重要,是因为其中包含了具体规模数据:13 个工作进程、接近 12 天的运行时间、1,703 次贡献,以及朝向训练好的 GPT-2 124M 目标缩小了 62% 的差距。这些数字让“共享记忆”从模糊概念变成了可检查的系统性主张。

移动工具领域也出现了并行执行案例。@sl1ma4 表示(8 个赞、12 条回复、944 次浏览、10 次收藏)称,Google 的 ARTEMIS 可以让 Claude Code、Codex 和 Antigravity 通过 MCP 使用真实 Android 设备;@hasantoxr 扩展(18 个赞、8 条回复、4,898 次浏览、7 次收藏)则强调了闭环的价值:构建应用、在设备上运行、捕获截图和跟踪信息,再根据观察到的失败修复代码。公开的 google/artemis README 支持了 MCP 集成、Flash/Pro 执行配置,以及人们反复提及的 99% 以上 AndroidWorld 结果。
讨论洞察: 这里的回复不太关心模型原始智力,而更关注代理能否保留证据、共享状态,并观察它们试图改变的真实环境。
与前一天的比较: 9 月 17 日已经倾向于托管式编排框架和长证明工作流。9 月 18 日则新增了明确命名的效率机制、共享记忆架构和真实设备执行,成为更具体的下一步。
1.4 构建者持续交付代理周边的层:运行时、队列、控制平面和技能(🡒)¶
小型构建者的活动仍集中在基础模型之上。copilot 的提及量在 9 月 17 日为 35 条,9 月 18 日仍保持高位,达到 34 条;最具体的项目帖子讨论的是封装、路由和分发,而不是新颖的模型行为。
@github 推广(43 个赞、12 条回复、11,547 次浏览、17 次收藏)介绍了 GitHub Copilot SDK:无需自行编写代理循环,就能嵌入会话、工具、MCP 服务器和流式事件。回复很能说明问题:多名开发者表示,代理循环已经不再是难点,因为生产环境的痛点在于人工审批门、回滚路径,以及决定哪些操作必须保持可逆。同样的上移趋势也出现在 GitHub 的 每周 Copilot 发布说明 中,其中新增了自动模型选择层级、基于 shell 的审查检查、Copilot 应用中的 Sentry 集成、VS Code Agents 窗口的使用指标,以及 AI 积分预算申请。
@kepochnik 介绍(16 个赞、6 条回复、893 次浏览)介绍了 MiniMax Code:一个完整的终端编码代理,支持测试、子代理、MCP、插件、会话续接,以及通过兼容 OpenAI 和 Anthropic 的 API 使用 BYOK。回复中的实际重点不是基准测试领先,而是可移植性:一个编码代理界面,多个供应商后端。
@DanKornas 推出(1 个赞、2 条回复、468 次浏览、2 次收藏)介绍了 apra-fleet,一个跨设备的代理工作流控制平面;随后发布(1 个赞、3 条回复、417 次浏览)则介绍了 Taskuary,一个本地优先的“收件箱到代理”任务中心,带人工审批节点。@DanKornas 还介绍了 分享(6 个赞、6 条回复、866 次浏览)中的 Geoscience Skills,这是一个包含 48 项技能的领域技能包,可安装到 Codex、Claude Code、Copilot 和 Gemini CLI。综合来看,这些帖子展现出一个一致趋势:构建者默认多个代理已经存在,正在争夺围绕这些代理的协调、路由、审批和垂直封装层。
讨论洞察: 更有野心的构建者并没有承诺“一个代理包打天下”,而是在现有代理后端之上封装队列、集群控制、审批节点或领域专属约束。
与前一天的比较: 9 月 17 日聚焦适配器和确定性封装。9 月 18 日延续了这一模式,但进一步推进到可复用运行时、多机器控制平面、收件箱编排和领域技能分发。
2. 人们感到沮丧的地方¶
支出、计费和配额界面仍然要等中断发生后才出现¶
最直接的挫折并不是存在使用上限,而是用户仍要等工作停滞后,才发现真正的边界。@OpenAIDevs 公开展示(495 个赞、79 条回复、60,791 次浏览、140 次收藏)展示了 Codex 按任务、子代理和聊天划分的使用情况,但回复立即要求提供例行流程级的优化指导,而不是把这项功能视为完整解决方案。@RileyRalmuto 新增(19 个赞、4 条回复、2,428 次浏览)则展示了更尖锐的失败模式:截图显示一笔付费 Codex 套餐费用,被标记为 Void;回复称 OpenAI 在相近日期已经需要发放储备重置额度。即使可信度较低的 @grokkedd 变通方案帖子(26 个赞、7 条回复、387 次浏览、18 次收藏)也属于同一问题:用户正在寻找替代访问池,因为主配额界面仍然构成限制。
GitHub 的 9 月 18 日 Copilot 更新日志 进一步说明,这并非单一供应商的问题。预算增加申请现在已全面开放,但只有用户触及 AI 积分上限后才能提交。这一问题的严重程度为高,因为现有的应对措施——分析页、预算申请流程、储备重置额度和替代产品传闻——仍然是在中断发生后才启动,而不是提前介入。值得投入建设:高。
在长时间运行的代理会话中,压缩和项目记忆仍然不透明¶
最深层的技术挫折来自用户无法预测或检查的记忆行为。@theo 认为(371 个赞、50 条回复、39,432 次浏览、170 次收藏)称,逐行压缩会破坏工具结果的连续性,迫使系统进行成本高昂的缓存重写,并丢弃外部摘要器无法恢复的推理轨迹。@thtbee_ 明确说明(224 个赞、16 条回复、19,719 次浏览、28 次收藏)则提出了对私有项目记忆、可检查记忆,以及在 Antigravity 中恢复跨聊天记忆的需求。
这一问题的严重程度为高,因为所有应对策略都只是次优方案:信任默认设置、保留超出需求的历史记录,或者手动重述系统遗忘的内容。当天研究帖与这一现象形成了鲜明对比。Stellar Colosseum、SoL-Pi 和 Agora 都把记忆、状态或证据保留视为编排框架层的设计问题,这说明用户正确识别出了一个缺失的系统层,而不只是抱怨用户体验。值得投入建设:高。
对于代理如今拥有的权限,插件和关联账户的信任层仍然过于脆弱¶
最强烈的恐惧信号来自这样一个事实:两起主要安全事件都发生在模型周边的层上。@justanotherlaw 放大传播(346 个赞、7 条回复、33,899 次浏览、187 次收藏)讲述了 OpenAI 漏洞事件;@IntCyberDigest 传播(377 个赞、24 条回复、22,016 次浏览、138 次收藏)则讲述了从公开论坛上传、到 SSO 接管、再到 Codex 发起 pull request 的完整链条。与此同时,Air Security 的 Plugin4Shell 分析文章 描述了另一项插件 SHA 固定绕过漏洞,可能将常规市场更新变成零点击远程代码执行。
这一问题的严重程度为高,因为其影响范围正好覆盖编码代理最有价值的部分:本地代码、密钥、SSH 密钥、关联 SaaS 工具和内部仓库。公开的修复指导——明确列出已修复的 Claude Code 和 Codex 版本、Gemini CLI 没有修复,以及披露时 Copilot 存在的缺口——表明用户已经在围绕编码助手进行类似事件响应的版本分诊。值得投入建设:高。
在代理成为可管理的工作者之前,团队仍需要队列和控制平面¶
另一个较低调但持续存在的挫折是协调开销。@DanKornas 总结(1 个赞、3 条回复、417 次浏览)直接指出:“你的收件箱里塞满了工作,你的代理需要一个队列。”同一作者在 表示(1 个赞、2 条回复、468 次浏览、2 次收藏)中表示,在多台机器上协调编码代理,不应要求用户“盯着每次运行”。@github 推广 Copilot SDK(43 个赞、12 条回复、11,547 次浏览、17 次收藏)下的回复从平台角度提出了同样的问题:即使 SDK 抽象了代理循环,难点仍在于决定哪些操作需要人工门控,以及如何撤销那些本不该发生的操作。
这一问题的严重程度为中,因为它不像失去访问权限或遭到入侵那样灾难性,但仍足以摧毁工作流。市场信号表明,构建者已经不再等待基础模型替他们解决这一问题,而是在单独构建队列、仪表板、审批和集群路由层。值得投入建设:中。
3. 人们希望存在什么¶
可持续存在、可检查且可引导的项目记忆¶
最明确的未满足需求不是让单次回答更聪明,而是一种能够跨越压缩、界面切换和长时间运行持续存在,同时不会变成黑箱的项目记忆。@theo 反对(371 个赞、50 条回复、39,432 次浏览、170 次收藏)反对外部压缩,因为它可能切断工具结果与使这些结果有用的推理之间的联系;@thtbee_ 明确要求(224 个赞、16 条回复、19,719 次浏览、28 次收藏)则要求在 Antigravity 中提供私有项目记忆、本地文件访问和跨聊天记忆恢复。即使是较为积极的 @OpenAIDevs 分析功能上线(495 个赞、79 条回复、60,791 次浏览、140 次收藏)也指向同一方向:用户想检查运行过程中发生了什么,而不是只相信助手记住了足够多的内容。
这是一项实际需求,而不是愿景。使用分析、默认压缩策略以及 Stellar Colosseum、SoL-Pi 和 Agora 等研究编排框架已经提供了部分答案,但目前还没有任何方案为普通用户提供一个横跨产品界面、简单且可检查的记忆层。机会:直接。
在故障发生前介入的支出和权限控制平面¶
第二项需求是预防性治理。各种信号高度一致:@OpenAIDevs 发布(495 个赞、79 条回复、60,791 次浏览、140 次收藏)关注 Codex 使用分析,因为人们需要了解额度花在了哪里;@RileyRalmuto 展示(19 个赞、4 条回复、2,428 次浏览)表明,套餐计费仍可能在信任最重要的时刻变得混乱;GitHub 的 每周 Copilot 发布说明 只在达到限额后才增加预算申请;Plugin4Shell 则展示了受信任插件供应链继承开发者全部权限后会发生什么。
人们似乎希望有一个统一层,在运行开始前回答四个问题:还剩多少预算?哪些记忆或上下文会保留?哪些关联账户或密钥处于作用范围内?哪些插件或操作路径获准执行?如今的控制分散在计费页面、按版本发布的安全公告、预算申请队列和人工凭据管理之间。机会:直接。
既能让人类掌控、又能管理代理工作的队列和控制平面¶
第三项未满足需求是工作流协调,而不是原始代码生成。@DanKornas 介绍(1 个赞、3 条回复、417 次浏览)将 Taskuary 描述为一个带审批节点的“收件箱到代理”队列;同一作者在 介绍(1 个赞、2 条回复、468 次浏览、2 次收藏)中将 apra-fleet 描述为一个用于跨机器、跨供应商运行长期任务的控制平面。@github 推销 Copilot SDK(43 个赞、12 条回复、11,547 次浏览、17 次收藏)下的回复从相反方向表达了同一观点:循环一旦被抽象出来,瓶颈就变成了路由、可逆性和人工门控。
这是一项已有实际原型的现实需求。竞争难点不是从零发明概念,而是提供一个比当前由终端、仪表板和聊天线程临时拼成的方案更简单的队列、审批、路由和可观测性层。机会:具有竞争力。
面向交互式软件的真实环境反馈闭环¶
第四项需求是一个执行层,让编码代理能够在实际目标环境中观察自己构建的东西。@hasantoxr 视为(18 个赞、8 条回复、4,898 次浏览、7 次收藏)强调 ARTEMIS 的重要性,因为它通过 MCP 让代理能够操作真实 Android 设备;@sl1ma4 表述为(8 个赞、12 条回复、944 次浏览、10 次收藏)则称其对移动测试和调试立即有用。@DemoWebAI 展示(3 个赞、2 条回复、46 次浏览)在基于浏览器的产品演示中展现了相同模式:提示工作流、在本地执行、观察结果,然后打包产物。
对于移动端、浏览器和高度依赖工作流的产品而言,这是一项现实需求,因为“代码能编译”远远不足以作为证据。由于开源项目和初创公司实现已经存在,这一机会具有竞争性;但讨论中对更广泛的平台支持、更安全的凭据处理和更紧密修复闭环的需求也显而易见。机会:具有竞争力。
4. 正在使用的工具和方法¶
| 工具 | 类别 | 情绪 | 优势 | 局限 |
|---|---|---|---|---|
| Codex | 代理/运行时 | (+/-) | 按任务、子代理和聊天提供使用分析;关联账户工作流界面完善;广泛用于严肃构建者的工作流 | 配额耗尽、计费异常、对压缩敏感,以及关联账户遭入侵时影响范围巨大 |
| Claude Code | 代理 | (+/-) | 在漏洞利用、ARTEMIS 和编排框架讨论中仍被视为基准级同类产品;插件和 MCP 生态广泛 | 面临 Plugin4Shell 风险,并持续担忧压缩或代理层变化后哪些内容能够保留 |
| Antigravity | 托管式代理/运行时 | (+/-) | Teamwork 模式、ARTEMIS 集成,以及在 Gemini 4 Pro 发布前的强烈关注 | 用户仍希望获得更好的产品打磨、私有项目记忆、本地文件访问和恢复的跨聊天记忆 |
| GitHub Copilot | IDE/运行时平台 | (+/-) | 提供会话、工具、MCP 和流式事件的 SDK;自动模型层级;审查和 Sentry 集成 | 预算增加流程是被动触发的,人工门控仍在外部,披露时的供应链担忧也波及 Copilot |
| ARTEMIS | 设备自动化 / MCP | (+) | 控制真实 Android 设备、截图、Logcat、Flash/Pro 模式,以及 99% 以上的 AndroidWorld 结果 | 当前以 Android 为主,iOS 仍在路线图中,设置仍依赖设备和工具链配置 |
| MiniMax Code | 终端编码代理 | (+) | BYOK、插件、MCP、会话续接和开源源码预览 | 生态较新,源码仍处于预览状态,平台和运行时要求提高了采用门槛 |
| SoL-Pi | 编排框架扩展 | (+) | 明确命名的效率机制、更低的令牌流量、更低的 API 成本,以及开源发布 | 增加配置复杂度,解决的是编排框架效率问题,而非更广泛的用户体验或控制平面问题 |
| apra-fleet | 代理运维 / 控制平面 | (+) | 跨设备成员注册、基于层级的模型路由、仪表板、持久工作流和带外密钥 | 多机器编排天然运维负担较重,相较供应商平台仍属小众 |
| Taskuary | AI 任务中心 | (+) | 统一收件箱、AI 分流、编码代理路由、实时工作区,以及操作前人工审批 | 仍是早期的 pre-1.0 产品界面,依赖连接器和运营者审查 |
| Geoscience Skills | 领域技能包 | (+) | 面向多个代理和科学格式提供 48 项可移植技能,并为实际垂直领域工作封装工作流 | 需要特定任务依赖,面向的专业受众比通用编码工具更窄 |
| DemoWeb | 浏览器自动化 / 演示生成 | (+/-) | 在聊天工作流中将提示驱动的浏览器流程转换为带旁白的 1080p 视频和 PDF 报告 | 早期 traction 有限,并面临其他执行层同样的本地浏览器凭据和安全问题 |
当工具能够缩小范围或让操作变得清晰可见时,整体满意度最高。ARTEMIS、SoL-Pi、apra-fleet、Taskuary、Geoscience Skills 和 MiniMax Code 都通过减少歧义获得关注:其中一个让代理拥有真实手机,一个明确列出编排框架成本机制,一个管理代理集群,一个组织流入的工作,一个封装垂直领域,另一个则明确了供应商可移植性(ARTEMIS、SoL-Pi、apra-fleet、Taskuary、Geoscience Skills、MiniMax Code)。
混合情绪主要集中在通用平台上。Codex、Claude Code、Antigravity 和 Copilot 都被大量认真使用,但当天的证据不断将这些使用与预算可见性、压缩、记忆控制或供应链信任方面的限制联系起来(OpenAIDevs 使用分析、theo compaction 讨论串、thtbee_ Antigravity 愿望清单、GitHub 更新日志、Plugin4Shell)。
这些绕过方案很能说明问题。人们要求储备重置额度、盯着分析页、在 Prism 中寻找替代 Astra 访问途径、坚持采用人工审批闭环,或者将状态转移到明确的编排框架产物中,而不是相信基础代理能记住一切。最清晰的迁移趋势包括:从单一供应商代理界面转向 BYOK 或多供应商路由;从只写代码的代理转向通过 ARTEMIS 或 DemoWeb 执行真实环境;从通用助手转向 Geoscience Skills、Taskuary 和 apra-fleet 等领域或工作流封装。因此,竞争正在向上游移动:模型质量仍然重要,但当前的竞争越来越集中在运行时、控制、协调和证据界面。
5. 人们正在构建什么¶
| 项目 | 构建者 | 功能 | 解决的问题 | 技术栈 | 阶段 | 链接 |
|---|---|---|---|---|---|---|
| ARTEMIS | 让 AI 助手和测试套件通过 MCP 驱动真实 Android 设备 | 编码代理可以编写移动代码,但仍需要真实设备闭环来观察界面故障、日志和跟踪信息 | Python 3.12+、MCP、ADB、scrcpy/FFmpeg、多模态模型 | Beta | 帖子、仓库 | |
| Stellar Colosseum | @mirrokni | 面向长期证明和研究工作流的多代理编排框架 | 长证明和定理式研究需要策略探索、分解、批判和验证,而不是一个长提示词 | Gemini 3.1 Pro、Gemini 3.7 Flash、Lean 验证、Antigravity Teamwork 模式 | Beta | 帖子、论文 |
| SoL-Pi | NVIDIA / NVlabs | 提升编排框架执行令牌效率的开源 Pi 扩展 | 长时间代理运行会浪费轮次、重复过大的观察结果,并为在上下文中保留证据支付过高成本 | Node.js 22.19+、Pi coding agent、JSON 配置、扩展 API | Beta | 帖子、仓库、论文 |
| MiniMax Code | MiniMax-AI | 支持 BYOK、MCP、插件和会话续接的终端编码代理 | 构建者希望拥有完整的 CLI 代理,但不想绑定单一模型供应商 | Node.js 22.19+、npm、兼容 OpenAI 的 API、兼容 Anthropic 的 API、插件、MCP | Beta | 帖子、仓库 |
| apra-fleet | Apra-Labs | 用于跨机器、跨供应商运行代理工作流的控制平面 | 长时间运行的代理工作需要在真实机器之间进行路由、可观测性、密钥管理和可恢复工作流 | Node.js 22+、MCP、工作流引擎、仪表板、供应商 CLI | Shipped | 帖子、仓库 |
| Taskuary | ldbumble | 本地优先的“收件箱到代理”任务中心,带审批节点 | 团队需要一个能将流入请求转化为有序代理工作的队列,同时保留人工审查 | Python 3.10+、本地 Web 应用、编码 CLI 连接器、审批工作流 | Beta | 帖子、仓库 |
| Geoscience Skills | SteadfastAsArt | 面向多个编码代理的可移植地球科学工作流技能包 | 专业科学工作经常要在每个代理中重复构建相同的工具选择层 | Agent Skills 格式、skills CLI、Python 领域库、工作流包 | Shipped | 帖子、仓库 |
| DemoWeb plugin | @DemoWebAI | 根据聊天提示生成浏览器录制的演示视频和 PDF 报告 | 产品演示和入门流程仍需要重复的人工录制和编辑 | 本地代理、浏览器自动化、MP4/PDF 导出、可选 Runway/Kling 配对 | Beta | 帖子 |
| Image Metadata Remover | @raywongy | 在客户端从图片中清除 EXIF、XMP 和 AI 元数据的小工具 | 如今,简单的日常工具已经可以由代理一次性构建,不再需要花费整个周末打造副项目 | 客户端 Web 应用;帖子未说明具体技术栈 | Alpha | 帖子 |
最重要的构建模式是位于代理之上的控制层。apra-fleet 和 Taskuary 解决的是相邻的工作流问题:前者在真实机器上协调供应商、设备、密钥和持续数小时的工作流;后者则将混乱的流入工作转化为带明确审批和运营者审查的队列。两者都说明,构建者认为下一个产品机会不是又一个助手窗口,而是代理工作的运行层。


第二种模式是可复用的专业化。Geoscience Skills 将垂直领域封装为可移植技能,而不是再做一个模型封装;ARTEMIS 则将真实设备执行封装为可复用的 MCP 层,而不是另做一个定制移动测试编排框架。Stellar Colosseum 和 SoL-Pi 在研究领域也符合这一模式:前者将长期证明工作分解为明确阶段,后者则将自动研究发现的效率机制封装成可安装扩展。

MiniMax Code 是通用 CLI 类别中最清晰的竞争进入者。该仓库强调项目编辑、测试、会话续接、插件、MCP,以及兼容 OpenAI 和 Anthropic 的 BYOK,这意味着其差异化在于工作流可移植性,而不仅仅是专有基础模型。

规模最小、但最能说明问题的构建,是那些已经能够返回成品的项目。DemoWebAI 展示了 ChatGPT 和 Codex 生成一个可安装的插件工作流:它可以录制浏览器操作,并返回 1080p MP4 和 PDF 报告;@raywongy 展示(5 个赞、3 条回复、608 次浏览)则展示了一个可运行的一次性 Antigravity 构建,用于移除图片元数据。这些帖子很重要,因为它们表明,代理式编程的长尾正在从基础设施工作扩展到简单的可交付工具和营销素材。



SoL-Pi 和 Stellar Colosseum 还共同展现了反复出现的研究到产品闭环。前者已经作为扩展开源,并提供安装文档和保守的自愿启用默认设置;后者则已被描述为 Antigravity Teamwork 的 Long Proof 模式的一部分。ARTEMIS 从测试侧补全了这一图景:它将真实手机视为编码代理应当能够观察并据此修复的另一种环境。
6. 新进展与值得关注的事项¶
Codex 获得了一级使用分析界面¶
@OpenAIDevs 宣布(495 个赞、79 条回复、60,791 次浏览、140 次收藏)称,Codex 现在可以按任务、子代理和聊天拆分使用量。这一点很重要,因为配额管理已经从后台计费问题变成了产品内部可见的运行界面。
Plugin4Shell 让代理供应链安全问题无法再被忽视¶
Air Security 披露,以及 @The_Cyber_News 对其进行总结(13 个赞、1,547 次浏览)的呼应,让插件 SHA 处理成为主流编码代理话题。其值得关注之处不仅在于受影响的产品列表——Claude Code、Codex、Copilot 和 Gemini CLI——还在于零点击自动更新路径,以及按版本明确列出的修复状态。
ARTEMIS 将真实手机执行带入日常编码代理讨论¶
@sl1ma4 发布(8 个赞、12 条回复、944 次浏览、10 次收藏)和 @hasantoxr 扩展(18 个赞、8 条回复、4,898 次浏览、7 次收藏)讨论了 google/artemis,因为它通过 MCP 让代理从代码生成进一步进入真实设备观察、测试和修复阶段。这比仅依赖模拟器或截图的工作流前进了一大步。
GitHub 持续将 Copilot 扩展为平台,而不只是助手¶
GitHub 的 每周 Copilot 发布说明 新增了自动模型层级、审查改进、Copilot 应用中的 Sentry 集成、Agents 窗口使用指标,以及 AI 积分预算申请。与 @github 推广 Copilot SDK(43 个赞、12 条回复、11,547 次浏览、17 次收藏)结合来看,这一信号表明,平台界面规模已经成为竞争的重要组成部分。
7. 机会在哪里¶
[+++] 代理的支出、记忆和权限控制平面 — 这是数据集中最强的交叉信号。Codex 使用分析、RileyRalmuto 的作废扣款截图、thtbee_ 对可检查记忆的请求、Theo 对压缩的批评、GitHub 发布的预算申请、OpenAI 漏洞利用链和 Plugin4Shell,都指向同一个缺失层:在运行出错之前,用一个地方理解成本、持久性、关联账户、插件信任和人工门控。
[++] 代理团队的队列和编排层 — Taskuary、apra-fleet,以及 Copilot SDK 帖子下的回复都表明,下一个问题是路由和治理工作,而不是再生成一条回复。机会中等偏强,因为原型已经存在,但在简单性、审批和多供应商执行方面,市场仍然开放。
[++] 让代理能够测试所构建内容的闭环执行层 — ARTEMIS 通过 MCP 为编码代理提供真实 Android 设备,DemoWeb 将浏览器操作转换为录制产物,而 Stellar Colosseum 与 SoL-Pi 则在研究和编排框架效率领域展示了相同模式:代理能够观察环境并保留证据后,会变得更有用。这一机会尤其适合移动端、浏览器和高度依赖工作流的产品。
[+] 垂直技能包和小型可交付工具 — Geoscience Skills 和由 Antigravity 构建的 Image Metadata Remover 展示了同一市场的两端:面向专业人士的可复用领域封装,以及面向个人的轻量级一次性工具。这一信号正在形成但尚未占据主导地位,不过它表明,未来的分发可能越来越多地通过可移植技能、工作流和以产物为先的构建完成,而不是通过单体式新应用。
8. 要点¶
- 使用可见性如今已经是产品界面的一部分,而不是管理员事后补上的功能。 OpenAI 发布了按任务、子代理和聊天划分的 Codex 使用分析;GitHub 也在同一个 24 小时窗口内扩展了 Copilot 的指标和预算流程。(OpenAIDevs、GitHub 更新日志)
- 安全叙事已经明确从模型行为转向模型周边的各个层。 OpenAI 漏洞利用链和 Plugin4Shell 涉及的都是论坛、SSO、插件和关联系统,而不是模型自主失控。(IntCyberDigest、Air Security)
- 编排框架设计正在成为可见的竞争层。 Stellar Colosseum、SoL-Pi、Agora 和 ARTEMIS 都将协调、共享状态、观察或压缩视为一等工程问题,并提供了明确命名的机制和可衡量结果。(Stellar Colosseum、SoL-Pi、Agora、ARTEMIS)
- 构建者活动最活跃的领域正集中在控制平面、队列和垂直封装。 apra-fleet、Taskuary、Geoscience Skills、DemoWeb 以及一次性元数据移除工具都表明,构建者正在围绕现有代理封装工作流,而不是等待一个通用助手解决整个技术栈。(apra-fleet、Taskuary、Geoscience Skills、DemoWebAI、raywongy)