Twitter AI 编码 - 2026-09-22¶
1. 人们在讨论什么¶
1.1 发布首日的经济账与上线摩擦,取代了对泄露消息的追逐(🡕)¶
当天最大的主题,已经不再是 GPT-6 Sol 和 Luna 是否真的存在,而是它们上线得有多快、价格是多少,以及用户该如何围绕重置时间精打细算地分配用量。支撑这一主题的共有六条内容:重置倒计时帖、当日发布汇总、GitHub 对 Opus 5.5 的官方上线,以及一张来自 T3 Code 的模型选择器实拍图。
@kimmonismus 表示(587 次点赞、56 条回复、39,045 次浏览)称 Codex 即将重置,提醒人们应在窗口关闭前把剩余额度用掉。@codex_resets 发文称(230 次点赞、20 条回复、51,288 次浏览、37 次收藏)给出了明确的 9 月 23 日 07:00 UTC 时间点,并链接了 Tibo 的公开预告,让讨论焦点从模型传闻转向配额重置时点。@K1DBiBi 补充道(8 次点赞、4 条回复、237 次浏览)则呈现了这一行为最普通用户化的版本:一次积攒下来的 Astra Codex 重置意味着大约还剩一小时,可以把剩余额度烧完。
@btibor91 总结道(52 次点赞、10 条回复、3,421 次浏览、9 次收藏)把当天的发布经济账集中列了出来:GPT-6 Sol 每百万 token 输入 $2、输出 $10;GPT-6 Luna 则是 $0.10 和 $0.50;Claude Opus 5.5 的定位大致相当于 Fable 5.1 级别,但价格比 Opus 5 低 40%。附带的对比表之所以重要,是因为它不只是重复营销名称,而是显示出社区如何第一时间把这些发布换算为编程、研究和计算机使用上的相对预期。

@github 宣布(120 次点赞、10 条回复、12,827 次浏览)称 Claude Opus 5.5 现已在 GitHub Copilot 中可用,而其链接的 GitHub 更新日志 表示,GitHub 观察到它在任务解决效果上与 Opus 5 相当,但所需步骤和 token 更少。@jullerino 展示了(79 次点赞、9 条回复、1,482 次浏览、11 次收藏)则把同样的上线压力体现到了工具层面:T3 Code 已在其选择器中提供 Claude Opus 5.5、GPT-6 Sol 和 GPT-6 Luna,但要等缓存过期,或手动删除缓存文件后才会显示。最有分量的回复并不是炫耀基准成绩,而是在追问:为什么发现新模型仍然需要清缓存,为什么重启还不能做到一键完成。

讨论洞察: 回复不断把发布消息还原成操作层面的具体问题:模型会出现在什么入口、额度是否会按时重置、缓存状态是否掩盖了上线,以及 token 用量降低是否真的会改变实际支出。
与前一日对比: 9 月 21 日,公开证据主要围绕泄露、A/B 目击,以及发布前的路由线索。到 9 月 22 日,讨论已转向已确认的定价、已确认的重置行为,以及它们在真实工具中的即时可用性。
1.2 护栏与证明系统,比“自主性演示”更能赢得尊重(🡕)¶
第二个强势主题是,构建者把自己的可信度押在控制层上,而不是再去宣称 agent 正在神奇地变聪明。支撑这一主题的共有四条内容:测试回执、破坏性命令拦截、harness 与 sandbox 的架构分工,以及反复强调的一点——审批边界必须设在造成损害之前,而不是之后。
@neil_xbt 认为(7 次点赞、6 条回复、324 次浏览)表示,agent 的可靠性问题是回执问题,不是模型问题。他把 alibi 描述为两个 Claude Code hook:一个把测试命令改写为带回执的运行,记录退出码、通过数量和树指纹;另一个则会在 agent 声称测试已通过、但对应代码树已经过期时,拒绝让它结束。配图之所以重要,是因为它展示了精确的失败场景:一次看似“全绿”的声明,在后续修改使回执失效后被拦下。

@DanKornas 分享了(13 次点赞、9 条回复、770 次浏览)介绍了 dcg——一个会在执行前拦截破坏性 shell 和 Git 命令的命令 hook。他的推文列出了对 Claude Code、Codex CLI、Gemini CLI、GitHub Copilot CLI、Cursor、Hermes Agent 等的支持,以及 50 多个规则包和一种 CI 扫描模式。公开的 dcg 仓库 将同一个项目描述为一个 Rust 安全钩子,会在破坏性命令执行前将其拦截。这也解释了为什么回复会把它说成几乎所有 agent harness 都可能应该默认配备的东西。
@NathanFlurry 认为(3 次点赞,1 条回复,255 次浏览,3 次收藏)表示,把 harness 运行在 sandbox 里是错误的生产模式,因为 sandbox 的影响半径会变成 agent 的影响半径。相反,他说,凭证、历史记录、监控和唤醒机制都应由后端负责,而 sandbox 应作为工具暴露出来。附带的图很简单,但能让人一眼看懂这套论点。

讨论洞察: 支持者的回复明确指出,问题不在于“不安全的提示词”,而在于缺少归属控制关卡、缺少当前状态证明,以及在 agent 的一个想法与破坏性副作用之间,没有执行前检查。
与前一天对比: 9 月 21 日强调的是运行时提速和可安装的 agent 扩展。9 月 22 日则更深入一层,转向团队在这些 agent 开始接触真实代码仓库和基础设施之后,如何证明、约束并监督它们。
1.3 工作流适配性仍然胜过平台野心(🡒)¶
第三个主题是:相比那些要求用户接受整套全新框架的大型 AI 界面,范围更窄的集成和保留现有工作流的软件包赢得了更多好感。有五个条目支撑了这一主题:一则附带可视化证据的 GitHub 仪表盘抱怨、一种跨模型插件模式、作为现有 IDE agent 手机控制层的 ARTEMIS,以及对 Google 更大范围 Antigravity 技术栈是否已赢得广泛开发者信任的直接质疑。
@RhysSullivan 写道(123 次点赞,8 条回复,4,606 次浏览)表示,对于一个日常工作主要是在系统里推进 PR 的人来说,GitHub 仍然给 Copilot 留了太多空间。这张截图之所以重要,是因为它并不是抽象的反 AI 情绪,而是精确标出了他认为被浪费的仪表盘区域,相较于他真正需要的工作界面,这些位置本不该被占用。

@martitech_ 认为(4 次点赞,3 条回复,74 次浏览)表示,OpenAI 的 用于 Claude Code 的 Codex 插件 真正有意思的地方,不只是 Claude 可以“连接到 ChatGPT”,而是一个模型可以负责构建,另一个模型则负责审查、质疑和验证。公开仓库也印证了这一点,其中明确提供了只读审查、对抗式审查、救援委派、移交以及后台任务管理等命令,让这条帖子不只是一个比喻,而是一个具体的多模型工作流软件包。
@rammcodes 报道称(19 次点赞,4 条回复,782 次浏览,12 次收藏)表示,Google 的 ARTEMIS 让 agent 可以通过 MCP 使用一部真实的 Android 手机。该仓库称,它是一个原生支持 MCP 的 Python 服务器,在 AndroidWorld 上的完成率超过 99%,刷写循环为 3–5 秒,并提供了面向 Antigravity、Codex、Claude Code、Windsurf 等客户端的直接配置路径。但对于更大的 Googlebook 宣传说法,@GergelyOrosz 提出异议(148 次点赞,19 条回复,35,647 次浏览,15 次收藏)提出了质疑,认为 Antigravity 仍缺乏广泛的外部吸引力,而 Gemini 的编程口碑也落后于第一梯队;回复中最有价值的纠正是,这套硬件依然暴露了 Linux 终端,因此即便用户忽略 Antigravity,也仍然可以运行 Claude 或 Codex。
讨论洞察: 反复出现的模式不是“选出唯一赢家”,而是“让我保留当前工作流,再加上一层有用的能力”:更好的审查闭环、一个手机控制 MCP,或者一个 AI 区域更少、更精简的仪表盘。
与前一天对比: 9 月 21 日就已经更偏向技能、插件和模型提供方层,而不是彻底替换编辑器。9 月 22 日进一步强化了这种偏好,更明确地要求更精简的界面,也更赞赏那些能保留现有习惯的附加组件。
2. 什么让人感到沮丧¶
限额、重置和发布状态仍然太难管理¶
最强烈的挫败感并不单纯来自模型质量本身,而在于用户至今仍要围绕配额、重置和可用性不一致做大量运维式的手工管理。@kimmonismus 表示(587 次点赞、56 条回复、39,045 次浏览)提醒人们,应在重置前把剩余的 Codex 配额用完;而 @codex_resets 发文称(230 次点赞、20 条回复、51,288 次浏览、37 次收藏)则给出了具体重置时间,并在回复中引出了关于时区的提问。@K1DBiBi 转而(8 次点赞、4 条回复、237 次浏览)也把同样的模式带入了日常行为:Astra Codex 积存的配额即将重置,意味着大约只剩一个小时来用掉剩余额度。
发布推进这一层面又制造了第二类摩擦。@jullerino 展示了(79 次点赞、9 条回复、1,482 次浏览、11 次收藏)表示,T3 Code 用户有时需要先删除缓存文件,新模型才会出现;回复里随即有人要求加入应用内刷新功能。@btibor91 指出(52 次点赞、10 条回复、3,421 次浏览、9 次收藏)则表示,Sol 和 Luna 正在逐步推出,而 ChatGPT 的上线进度落后于 Work/Codex 界面。
应对办法几乎全是手动操作:在重置前用掉配额、盯第三方重置追踪器、清理模型清单缓存,以及反复查看当前界面是否终于完成推送。严重性:高。值得构建:高。
当 AI 产品界面挤占实际工作时,产品仍会失去用户好感¶
最明确的 UI 抱怨,并不是人们原则上反感 AI 帮助,而是太多界面仍在要求用户围绕 AI 产品重组自己的工作流。@RhysSullivan 写道(123 次点赞、8 条回复、4,606 次浏览)表示,GitHub 给 Copilot 分配的空间相对于他真正关心的 PR 吞吐量来说太多了,而他附上的截图也让这一抱怨变得非常直观。@GergelyOrosz 批评(148 次点赞、19 条回复、35,647 次浏览、15 次收藏)则质疑 Googlebook 那套要把 Antigravity 和 Gemini 置于核心位置的说法,因为外界对开发者采用情况和代码质量仍然心存疑虑。
同样的挫败感,也以更小但更尖锐的形式出现在工具切换诉求中。@HarshithLucky3 询问(19 次点赞、527 次浏览)要求 Antigravity、Claude 桌面版和 ChatGPT 桌面版支持多账号;而对 @jullerino 的回复,则要求提供一键刷新模型,而不是让用户去折腾文件系统。这些抱怨针对的是工作流,不是基准测试。
人们的应对方式,是选择更窄的一层来保住底层工作流:插件、MCP 服务器、只读审查命令,或者大平台里的普通终端。严重性:中。值得构建:高。
团队仍然不信任代理能正确自报状态或自我设限¶
信任问题依然非常具体。@neil_xbt 认为(7 次点赞、6 条回复、324 次浏览)表示,代理经常声称测试已通过,却无法根据当前代码树证明这一点,这也是他构建 alibi 的原因:为测试运行留痕,并阻止基于过期“绿色通过”状态的总结。@DanKornas 分享了(13 次点赞、9 条回复、770 次浏览)将 dcg 描述为一个执行前审批边界,用于处理高风险的 Git 和 shell 命令;回复则表示,这道边界应在工作树被破坏之前就存在,而不是之后。@NathanFlurry 扩展了(3 次点赞、1 条回复、255 次浏览、3 次收藏)又把同样的逻辑延伸到基础设施层面,认为凭据、历史记录和监控应完全留在沙箱之外。
这种权宜模式非常一致:加钩子、把控制平面放在执行盒子之外,并让每一次高风险状态切换都可审计。人们要的不是一个更会“鼓舞人心”的代理,而是一个其说法和副作用都能被核查的代理。严重性:高。值得构建:高。
3. 人们希望存在什么¶
与突发式代理工作相匹配的配额控制¶
最直接的需求,是为代理式突发使用提供更好的用量控制。@kimmonismus 展示了(587 次点赞、56 条回复、39,045 次浏览)以及 @codex_resets 展示了(230 次点赞、20 条回复、51,288 次浏览、37 次收藏)都表明,用户会围绕重置窗口安排工作时间;而 @K1DBiBi 描述了(8 次点赞、4 条回复、237 次浏览)则是在抢在累积重置生效前,用完剩余额度。这种需求很实际:人们想要用量预测、考虑路由因素的支出控制,以及把重置做成一项便于规划的功能,而不是一次突如其来的事件。
眼下的部分替代方案全都是间接的。人们会盯着重置追踪器、提前消耗额度,或者在高价模型那一轮用完后,把工作转到更便宜的模型上。这种行为证明了需求存在,但这不是产品层面的解法。机会:直接。
无需繁琐操作或文件系统 hack 的账户与模型切换¶
有多篇帖子提到,希望在 AI 工具之间更轻松地管理状态。@HarshithLucky3 询问(19 次点赞、527 次浏览)呼吁在 Antigravity、Claude 桌面版和 ChatGPT 桌面版之间提供多账户支持。@jullerino 展示了(79 次点赞、9 条回复、1,482 次浏览、11 次收藏)则表明,即使新模型在技术上已经上线,用户仍可能需要手动清除缓存后才能看到;回复中还明确要求提供一键重启。
这不是面子需求,而是实际需求。人们要管理多个订阅、多个仓库和多个模型层级,不希望周边的 UI 状态也变成另一个需要时刻盯着的对象。机会:竞争型。
将构建与校验分离的跨模型工作流¶
最强烈、也最具前瞻性的需求,是把“一个模型负责构建,另一个模型负责校验”这种模式,做成易于复用的封装。@martitech_ 认为(4 次点赞、3 条回复、74 次浏览)指出,Claude Code 加上 适用于 Claude Code 的 Codex 插件 之所以重要,是因为不同模型在审查时会带入不同的假设和盲点。@neil_xbt 构建 提到,他们需要用于测试验证的证明钩子,而不是相信单个 agent 的总结;@rammcodes 重点展示 则把 ARTEMIS 做成一个 MCP 包,让多个现有 IDE agent 都能获得同样的真机测试能力。
人们似乎想要的,不是再来一个一体化的庞大 agent,而是可复用的审查闭环、验证钩子,以及能够直接接入他们现有客户端的领域包。机会:直接。
4. 正在使用的工具与方法¶
| 工具 | 类别 | 情绪 | 优势 | 局限 |
|---|---|---|---|---|
| GPT-6 Sol | LLM / 编码模型 | (+/-) | 价格低于 GPT-5.6 的促销费率,编码/写作能力更强的说法也获得关注,并且很快就在 Codex 和工具封装层中上线 | 逐步推出,此前存在隐藏路由引发的困惑,仍受配额/重置焦虑影响 |
| GPT-6 Luna | LLM / 高吞吐模型 | (+) | 价格极低,适合专注型、高吞吐工作;与 Sol 同步发布 | 可见性取决于前端界面的推出进度和模型缓存状态 |
| Claude Opus 5.5 | LLM / 编码与知识工作 | (+) | 在 GitHub 的早期测试中,比 Opus 5 步骤更少、token 用量更低;Copilot 可用范围广 | 逐步推出和 SKU 限制仍然重要 |
| GitHub Copilot | IDE / 应用 / CLI agent 界面 | (+/-) | 官方模型上线快,模型选择器覆盖面广,工作流集成成熟 | 仪表盘蔓延以及评审界面的放置位置,仍让重度 PR 用户感到沮丧 |
| Antigravity | Agent IDE / harness | (+/-) | 可作为 ARTEMIS 这类 MCP 插件的宿主,也是 Google 更大技术栈的一部分 | 对采用它的怀疑依然存在,而且用户明确想要多账户支持 |
| ARTEMIS | MCP 移动测试层 | (+) | 可控制真实 Android 手机、抓取截图和 Logcat,AndroidWorld 结果达 99%+,兼容多个客户端 | 仅限 Android,且仍依赖外部 harness/IDE |
| dcg | 安全钩子 | (+) | 在执行前拦截破坏性 shell 和 Git 命令,支持多种 agent 集成、规则包和 CI 模式 | 增加审批策略开销,团队仍需自行定义哪些操作必须由人工批准 |
| alibi | 验证钩子 | (+) | 将测试运行变成可核验的凭证,并阻止在错误代码树上出现过期却仍显示“绿色通过”的说法 | 聚焦范围较窄,目前呈现为一个小型 Claude Code 钩子包 |
| Codex plugin for Claude Code | 多模型插件 | (+) | 无需离开 Claude Code,即可使用 review、adversarial review、rescue、transfer 和 status 命令 | 仍依赖 Codex 认证、本地安装和 Codex 使用限制 |
总体来看,满意度主要集中在这样一层:某个工具能把具体工作流做得更便宜,或更容易验证。GPT-6 Sol、Luna 和 Opus 5.5 在人们能把它们直接和更低成本或更少步骤联系起来时,整体反馈是积极的;但一旦推出状态、缓存状态或使用限制开始碍事,这种好感就会减弱。常见的变通方式包括手动清缓存、按任务显式拆分模型、用第二个模型做评审,以及借助外部钩子提供证明或安全控制。竞争态势正在从“哪个单一模型胜出”转向“哪套技术栈能给我成本控制、验证能力,以及最少的工作流干扰”。
5. 人们正在构建什么¶
| 项目 | 构建者 | 功能 | 解决的问题 | 技术栈 | 阶段 | 链接 |
|---|---|---|---|---|---|---|
| ARTEMIS | Google via @rammcodes | 让 AI 助手控制真实 Android 设备、收集截图并捕获诊断信息 | 为现有编码 agent 提供真机测试和 bug 复现层 | Python、MCP、ADB、scrcpy、FFmpeg、多模态模型 | 已发布 | 仓库, 推文 |
| alibi | @neil_xbt | 为测试运行加上凭证,并阻止陈旧却仍显示“测试通过”的声明 | 证明 agent 最终的测试声明是否仍与当前代码树一致 | Claude Code hooks、shell/test wrappers、MIT package | Alpha | 推文 |
| Codex plugin for Claude Code | OpenAI,由 @martitech_ 推荐 | 在 Claude Code 中加入 Codex review、adversarial review、rescue、transfer 和 status 命令 | 将构建与检查分离,同时不必迫使用户离开当前客户端 | JavaScript、Claude Code 插件、Codex CLI 和 app server | 已发布 | 仓库、推文 |
| CL4R1T4S | @elder_plinius | 发布从主流 AI 系统中提取的 system prompt、guidelines 和 tool scaffolding | 为开发者提供一份公开参考,方便查看原本隐藏的 agent 指令与护栏 | GitHub 文本仓库 / prompt 档案库 | 已发布 | 仓库、推文 |
ARTEMIS 之所以突出,是因为它不是又一个聊天封装层。公开仓库显示,它将原生 MCP server 挂载到 Antigravity、Codex、Claude Code 和 Windsurf 等工具中,再通过真实 Android 设备或模拟器执行操作、截图、抓取 Logcat,并进行诊断回放。这也契合了当天更广泛的趋势:高信号的开发者是在现有 agent 客户端上补上某项明确缺失的能力,而不是试图替换整个环境。
alibi 和 dcg 分别从两端解决相邻的信任问题。alibi 试图证明某个已报告的测试结果对当前代码树仍然成立,而 dcg 则试图在灾难性命令改动代码树之前先将其拦下。两者共同展示了这份数据中反复出现的一种构建模式:验证层和安全层正被打包成可复用的 agent 侧车。
Claude Code 的 Codex 插件把多模型工作流明确到了足以照搬的程度。它的 README 展示了常规审查、对抗式审查、救援委派和持久转交,把“让另一个模型来检查这个”变成一组具体命令,而不再只是一种感觉。这与简单的模型切换是实质上不同的模式。

当天的项目组合还表明,透明性本身也正在成为一种产品。CL4R1T4S 不是 harness,也不是模型封装层,但它仍然吸引了大量关注,因为它把隐藏的 prompt scaffolding 变成了可检查的工件,供其他开发者研究、质疑或复用。
6. 最新与值得关注的内容¶
Aeon 的迹象指向 Codex 内部可配置的持久化 agent¶
@ChrisGPT 报道称(204 个赞,18 条回复,11,217 次浏览,29 次收藏)称,已发布的 Codex 代码中已经包含了 Aeon 专属字段,涉及模型选择、外观、云环境,以及一个专门的 thread/startAeon 操作。@argofowl 重新定义为(22 个赞,3 条回复,4,603 次浏览,6 次收藏)也将同样的证据解读为 Codex 内部可配置的 agent,而不只是又一个 bot 传闻。值得注意的不只是发布猜测本身,更在于这些符号描述了超出普通单会话助手范畴的 agent 身份、环境与生命周期控制。

一个公开的 prompt 档案库把隐藏的 Codex scaffolding 变成了共享工件¶
@elder_plinius 发布了(296 个赞,22 条回复,10,506 次浏览,115 次收藏)发布了他所称的一份 294,000 字符的 GPT-6 Sol Codex system prompt 和 tools 转储,并直接链接到 CL4R1T4S 仓库。公开的 CL4R1T4S 仓库 将自己描述为一个透明性档案库,收录从主流 AI 系统中提取的 prompts、guidelines 和 tool scaffolding;截至审阅时,它大约已有 50,000 个 stars。这使得 prompt 透明性本身在今天也成了一个值得关注的开发者信号,而不只是流言。

7. 机会在哪里[+++] 用于证据验证与副作用控制的 Agent 治理层 —— 证据同时来自多个板块:alibi 为测试声明提供的凭证、dcg 的执行前命令拦截机制,以及 Nathan Flurry 主张将凭证和控制权保留在沙箱之外的论述。这一模式之所以有力,是因为它针对的是一种反复出现的信任失效问题,而这一问题横跨编码、审查和基础设施执行。¶
[++] 具备成本感知的路由与配额运营 —— 关于重置倒计时的帖子、重置前先“烧额度”的行为、模型渐进式上线,以及通过清除缓存来显示新模型,这些都指向同一种需求:需要有一层足够了解价格、限额、上线状态和任务类型,从而能够自动调度工作的系统。相关证据具体且频繁,但这类方案将直接面对官方客户端的竞争。
[++] 封装为可复用工作流命令的跨模型审查循环 —— 面向 Claude Code 的 Codex 插件、ARTEMIS,以及对附加层更广泛的偏好,都指向这样一类产品:嵌入现有客户端,并为其新增一种能力。这是一个中等偏强的机会,因为需求清晰可见,但封装方式和用户体验可能比单纯的模型新颖性更重要。
[+] 面向重度用户的工作区状态管理 —— 对多账号支持的需求、一键刷新模型的诉求,以及反复出现的 Copilot 屏幕空间抱怨,都表明在外围状态层存在一个更隐性的真实机会:账号隔离、界面区域选择,以及低摩擦的模型可见性。这一信号仍在浮现,尚未占据主导,但可操作性很强。
8. 要点¶
- 发布当天的讨论已经变得更偏操作层面,而不只是横向比较。 人们对重置时间、上线入口和单任务价格的关注,与对模型本身质量的关注一样高。 (kimmonismus)
- 验证与安全侧车是当下 AI 编程中最清晰的构建类别之一。 alibi、dcg,以及关于沙箱控制平面的讨论,都表明开发者正把证据验证和影响范围控制视为一等产品工作。 (neil_xbt)
- 胜出的工作流模式依然是增量式的。 相较于要求用户采用全新工作方式的重 AI 界面,用户对插件、MCP 层和第二模型审查循环的反应更积极。 (martitech_)
- 持久化 Agent 的概念在产品尚未完全显现之前,就已进入公众视野。 Aeon 的代码痕迹已经描述了 Codex 内部的模型选择、外观、云环境和 Agent 启动操作。 (ChrisGPT)
- 提示词透明性本身已经成为一种信号。 CL4R1T4S GPT-6 Sol 转储之所以引发高度关注,是因为开发者越来越想检查那些塑造模型行为的隐藏指令。 (elder_plinius)