跳转至

Twitter AI 编程 - 2026-10-06

1. 人们在讨论什么

1.1 Antigravity 的 Gemini 4 Argon 传闻,已变成产品界面和运行流程层面的证据 (🡒)

Antigravity 依然处在信息流中心,但讨论的语气已经从笼统的路线图猜测,转向更具体的发布线索和交付流程证据。至少有四条被引用的内容指向同一个结论:人们正在通过 Arena、弃用通知、计费流程以及 Google 自己的编程演示来追踪 Argon,而不再把它当作一个模糊的未来模型。

@antigravity 表示(327 次点赞,25 条回复,13,162 次浏览,185 次收藏)展示了一套 Android 工作流:从一个提示开始,通过 Stitch MCP 拉取设计,构建原生 Jetpack Compose 组件,在模拟器中验证,并在真机上运行最终构建。这一点之所以重要,是因为它为当天声量最高的 Antigravity 讨论提供了一个真实的产品锚点:人们不仅在等 Argon,也在评估 Google 的 shell 是否已经支持严肃的端到端应用开发。回复区补充的是实操层面的细节,而不是炒作:有人要求内置浏览器,也有人指出“先模拟器、后真机”才是这套流程里最明智的部分。

@ash_twtz 报道称(821 次点赞,70 条回复,43,653 次浏览,42 次收藏)称,Gemini 4 Argon 已经在 Arena 中取代了 Gemini 3.8 Flash,并要求 Google 也在 Antigravity 中这样做。这条内容的重要性不主要在技术细节,而在于反应规模:回复几乎立刻变成了对发布时间的争论——到底会在当天上线,还是更接近 10 月 9 日——这表明,“盯发布”本身已经成为社区的一项重要活动。

@thtbee_ 认为(284 次点赞,13 条回复,11,715 次浏览,14 次收藏)称,10 月 6 日是 Antigravity 内 Gemini 3.6 Flash 和 3.7 Flash 的弃用日。配图是这组内容中最强的运营层面证据:其中一张显示了产品内的弃用提示卡,要求用户迁移到 Gemini 3.8 Flash;另一张则展示了底层通知元数据,其中一个 expirationDate 的值为 2026-10-06,并带有覆盖 free、plus、pro、ultra 和 ultra-lite 套餐的层级过滤条件。

Antigravity 的弃用提示卡,告知用户 Gemini 3.6 Flash 和 Gemini 3.7 Flash 即将下线

底层的 Antigravity 通知元数据,显示 Gemini 3.6 和 3.7 Flash 的弃用条目,expirationDate 为 2026-10-06

@HarshithLucky3 发现(139 次点赞,17 条回复,20,607 次浏览,26 次收藏)则提供了另一条发布线索,来自 Google One 升级流程:URL 中包含 argon_limit_reached。这本身还不足以证明已经上线,但已经具体到让回复立刻转向谁已经为 Ultra 付费,以及如果 Argon 被加入套餐,额度可能会是什么样。

Google One 升级页面的 URL,显示在与 Antigravity 相关的购买流程中出现了 argon_limit_reached

讨论洞察: 这一天的讨论并不只是泛泛的“快点发布吧”式炒作。人们在检查 Arena 替换、计费 URL、产品内弃用卡片和套餐层级元数据,而 Google 自己的 Android 演示也让这个 shell 本身显得值得持续追踪。

与前一天的对比: 相比 10 月 5 日当时 Antigravity 的讨论更多围绕 shell 设计、权限和配额权衡,10 月 6 日则把同一个竞争焦点进一步推向了更具体的发布线索,以及一套旗舰级移动工作流演示。

1.2 想以可控成本跑起 agent,依然比找到好模型更难 (🡖)

成本和运维依旧是一个主要主题,但相比 10 月 5 日,讨论变得更偏战术层面。10 月 6 日,用户谈论的重点不再主要是厂商政策,而是 reset、云积分、审批开销,以及如何在不耗尽套餐的前提下让多工具工作流持续运转。

@notjazii 总结道(23 次点赞,12 条回复,973 次浏览)将 OpenAI 在 Codex 第二天推出的更新描述为 Astra 和 GPT-6.1 Sol 的提速器,并附带免费自动审查。配图之所以重要,是因为它包含了具体的运行模式:Tibo 的截图写明,自动审查不再占用套餐额度,并将其定位为缓解决策疲劳的手段;同时还显示系统中已有 10,000 个操作流转,其中 720 个被自动审查,713 个获批后继续执行,7 个被拒绝,3 个暂停并向用户询问。在回复中,作者表示,他们自己的 Codex 在此前 30 天里大约消耗了 5,000 万 token,并在自动审查上花了约 70 美元。

Tibo 的 Codex 自动审查公告,显示其对已登录用户免费,并演示了已审查操作如何通过沙盒流转

@codex_resets 发帖称(77 次点赞,4 条回复,13,181 次浏览,14 次收藏)提到一个可能的 reset 预警,与 Tibo 那条“更新四次或者 reset 一次”的回复有关。所链接的 codex-resets.com 页面明确写着,其 watch 数据由 AI 分类而非官方数据,但页面仍显示了 57 次历史 reset、6.8 天的平均间隔,以及 160,816 名“begged for a reset”的用户。这很能说明,reset 时机已经成为实际工作流中的现实问题,而不只是一个梗。@realKevinPuray 写道(4 次点赞,4 条回复,227 次浏览)这是数据集中最清晰的一条重度用户路由说明:按他们的编码量,Claude Max 20x 只撑了五天,GPT-6 Astra 大约只撑了一天半,而可行的做法是在 Codex、Claude、Dots 和一个名为 Sky 的本地审批助手之间轮换。该帖还把 Cursor 和 Grok 机器人从现役工作站配置中退役,这说明一些操作者已经开始围绕套餐使用效率,非常激进地裁剪并重新平衡自己的工具栈。

@pengsonal 指出(7 次点赞,6 条回复,292 次浏览)这是面向付费用户的限时 Claude Code 云会话额度优惠:Pro 最多 $100,Max 最多 $250。这里附带的申领流程很关键,因为它表明厂商正从另一个方向回应同样的容量问题:不只是在调优模型行为,也在补贴后台执行。

讨论洞察: 即使在产品更新更多的一天里,用户说话的方式依然像是在资源压力下运作的操作者。Codex 更新下的一条回复称,速度提升的效果已经消退;而重置监测账号和云额度截图,则让大家关注的重点仍是余量,而不是模型本身的质量。

与前一天对比: 10 月 5 日强调的是套餐账和合并界面相关的政策问题。10 月 6 日则转向了战术性缓解措施:免费自动审查、重置预测、云会话额度,以及手动多订阅路由。

1.3 技能、注册表和封装层继续演变成独立产品(🡕)

10 月 5 日的包装化趋势仍在继续,但进一步逼近了分发与变现。最强势的项目已不再只是模板仓库,而是安装入口、发现层,以及围绕多个 agent 后端构建、让这些后端更易销售或复用的封装 UI。

@RoundtableSpace 强调了(54 次点赞,9 条回复,41,937 次浏览,53 次收藏)这是 awesome-skills 仓库。仓库描述称,它整理了面向 Claude Code、Codex、Gemini CLI、GitHub Copilot 及其他编码 agent 的技能、资源和工具;其 README 则将技能格式解释为渐进披露式的指令文件夹,而不是一次性提示词。这让该帖不只是一次清单式分享:它说明技能层正变成一种人们预期可以浏览和安装的东西。

@gabypadronp 宣布(79 次点赞,75 条回复,391 次浏览)称 @rokha_agent 已进入 GitHub MCP Registry,因此 Copilot 可以安装它,并运行工具,“而不只是聊天”。同一条帖子还在一个信息块里给出了定价和创作者经济机制:每天可免费进行两次真实运行,$99/月的 Network 方案,$249 的 Studio 方案,以及对发布他人会使用的 rig 的构建者提供 25% 的收入分成。

@msty_ai 发布了(2 次点赞,1 条回复,81 次浏览)这是 Msty Go 1.1 Beta 1,带有 Code Mode、文档工作流和内置 Living Wiki。这里的图片才是关键证据,因为它直接展示了这款产品的核心主张:会话、文件和审批都留在同一个地方,同时这个 shell 宣称兼容 Codex、Claude、Cursor、OpenCode、Grok Build 和 Pi。

Msty Go Code Mode,展示了一个包装式 UI,可在多个编码代理之上保留会话、文件、审批、文档工作流以及 Living Wiki

讨论洞察: 共同的动作不是发明一个全新的模型,而是围绕现有模型构建更好的分发方式:精选技能索引、MCP 注册表条目,以及把审批和上下文集中在一处的封装应用。

与前一天对比: 相比 10 月 5 日那波仓库和模板包装化浪潮,10 月 6 日新增了更清晰的安装入口和更直接的市场机制。

1.4 本地与私有替代方案在运营层面显得更可信(🡕)

开放和自托管替代方案背后有着异常具体的凭据。最有力的帖子并不止于“在本地运行”,而是明确给出硬件下限、吞吐数字、兼容 API,以及让私有栈可行的具体部署模型。

@NaceAI 开源了(48 次点赞,8 条回复,9,830 次浏览,19 次收藏)这是 Drex 1.1,被描述为一个构建在扩散语言模型骨干之上的实验性决策模型,可通过 llama.cpp、Ollama 或 Unsloth 在本地运行,并接入 Claude Code、Codex、Cursor 和 OpenCode 等 harness。链接中的 nace-ai/drex-dlm 仓库进一步佐证了这一点,其模型卡基于 NVIDIA Efficient-DLM-8B。@yume_arasaki 梳理了(7 个赞、3 条回复、267 次浏览、2 次收藏)讨论了在笔记本、台式机、DGX Spark 和 Mac 配置上运行 Qwen 3.8 Flash,并认为真正推动采用的关键因素,是 Strata 在 localhost 上提供了兼容 Anthropic 的 API,因此 Claude Code 和 Codex CLI 可以直接接入。图片补充了这条长帖赖以成立的运行细节:一个由 8 档硬件组成的性能阶梯、30 到 160 tok/s 的速度区间、最低需要 12 GB VRAM 加 32 GB RAM 的说法,以及针对多种配置给出的明确佐证。

Qwen 3.8 Flash 硬件分布图,展示了从笔记本级配置到 128 GB 机器的本地运行情况,并附有吞吐量和最低配置说明

@PajosTM 推荐了(5 个赞、1 条回复、165 次浏览)将 Tabby 描述为一款开源、自托管的解决方案,面向那些无法将专有代码发送到第三方服务器的团队。其链接的 TabbyML/tabby 仓库拥有 33,901 个 star,并将自己描述为 GitHub Copilot 的本地部署替代方案,提供编辑器扩展和多个 LLM 后端,这让其隐私主张背后有了一个已经落地的具体产品作为支撑。

Tabby 仓库页面,将其标注为自托管 AI 编码助手

@TimJayas 认为(26 个赞、3 条回复、1,687 次浏览)指出,在 Antigravity 中使用 Claude,意味着请求仍会经过 Google 的封装层,并受相关条款约束;这些条款允许 Google 记录交互数据,并将其用于改进自身的机器学习系统。这样的隐私视角也解释了,为什么在这一天,本地和本地部署替代方案会如此容易被理解。

讨论洞察: 支持本地或自托管工具的理由,建立在具体的接口与数据路径之上:localhost 上兼容 Anthropic 的 API、本地部署的代码助手,以及对交互数据究竟在哪里被收集的明确担忧。

与前一天相比: 9 月的报告已经显示出人们对混合式和本地执行的兴趣,但 10 月 6 日带来了比此前讨论通常更多的吞吐量、硬件和部署方面的直接佐证。


2. 什么让人沮丧

容量上限与套餐错配仍在左右工作流选择

最强烈的挫败信号并不只是模型质量本身,而是为了在多个重叠套餐之间维持足够余量、以完成实际工作所需付出的努力。@realKevinPuray 描述了(4 个赞、4 条回复、227 次浏览)提到,5 天内耗尽了 Claude Max 20x,大约一天半内耗尽了 GPT-6 Astra,随后只能通过在 Codex、Claude、Dots 以及一款名为 Sky 的本地审批助手之间轮换来补位。@codex_resets 记录了(77 个赞、4 条回复、13,181 次浏览、14 次收藏)则从社区角度呈现了同样的痛点——把重置时间做成一个专门的追踪界面;而 @pengsonal 曝光了(7 个赞、6 条回复、292 次浏览)则把一项短期的 Claude 云积分优惠当作后台执行的变通办法。共同的应对模式是叠加订阅、盯着重置时间,并把工作转移到任何仍有余量的资源池。严重性:高。值得构建:高。

Claude Max 使用页面警告称每周容量即将耗尽,进一步说明了用户为何会轮换使用不同套餐和工具

Claude 云会话积分领取流程,展示了一种针对后台执行容量的限时变通办法

可靠性和运维负担仍会打断流程

即便有可用额度,这些工具仍然需要过多人工盯守,或者会以浪费时间和机器资源的方式出问题。@notjazii 欢迎了(23 个赞、12 条回复、973 次浏览)之所以推出免费的自动审查,正是因为此前的默认流程要求人工批准一切;而一条回复则表示,所报告的速度提升在短短几小时内就已经消退。@nim_chimpsky_ 链接到(1 次点赞,190 次浏览)一则 Codex 桌面版缺陷报告称,browser_crashpad_handler 让一台 Mac 积累了 511 GB 的 minidump,并引来其他评论者反馈可复现出 180 GB 和 246.8 GB 的同类情况。这些属于不同的故障模式,但指向的是同一种挫败感:操作者为了让 shell 维持可用,仍然需要额外的护栏,以及过多的人工检查。严重性:高。值得构建:高。

Codex 桌面端清理提示,将 131.9 GiB 的崩溃报告列为首个删除目标

围绕托管代理的信任边界仍然过于模糊

信息流还显示,一旦代理开始代表用户浏览网页或进行代理转发,人们依然不清楚自己的代码、提示词和密钥究竟会流向哪里。@TimJayas 认为(26 次点赞,3 条回复,1,687 次浏览)指出,在 Antigravity 中使用 Claude,实际仍会通过 Google 的基础设施和条款处理,这一点很关键,因为这些条款写明交互数据可能会被记录,并用于改进 Google 的系统。@The_Cyber_News 报道称(22 次点赞,1 条回复,1,976 次浏览)提到一条 Copilot CLI 的提示注入链:一次对外部 URL 的 autopilot 审查,据称导致本地 .env.prod 文件被读取并外传。对此,@PajosTM 将其定位为(5 次点赞,1 条回复,165 次浏览)将 Tabby 视为更安全的运行模式,适合那些无法把专有代码发送到第三方服务器的团队。严重性:高。值得构建:高。

Antigravity 条款摘录,显示交互数据可能会被记录,并用于改进 Google 和 Alphabet 的机器学习系统

Cyber Security News 卡片,总结了所报道的 Copilot CLI cryptographic-context-injection 攻击路径


3. 人们希望出现什么

仅面向 Codex 的容量套餐,并与 ChatGPT 的其余部分更清晰分离

这组数据中最明确的产品诉求,是推出一种按编程容量出售的 Codex 套餐,而不是把它作为更大 ChatGPT 捆绑包中的一部分。@StefanoGPT 提出了(2 次点赞,3 条回复,708 次浏览)提出了一个简单结构:仅限 Codex 使用,没有 Dots,没有 ChatGPT,没有图像,20x 定价 $200,50x 定价 $400。这个请求也与 @realKevinPuray 记录了(4 次点赞,4 条回复,227 次浏览)中的重度用户证据相吻合:为了让编程会话持续进行,不得不在多个订阅之间切换路由;也与 @codex_resets 现有的(77 次点赞,4 条回复,13,181 次浏览,14 次收藏)所反映的情况一致——这只有在当前套餐边界仍让人觉得不稳定时才说得通。这是一个会立刻影响预算和工作流的现实需求。机会:直接。

仅含 Codex 的方案模型图:在不捆绑 Dots、ChatGPT 或图像功能的情况下,提供 20 倍或 50 倍的编码能力

在无需持续盯守的前提下,提供更多受监督的自主性

人们看起来并不是想要更少的自主性,而是希望在手动审批轰炸和盲目执行之间,有一个更好的中间层。在 @antigravity 展示了(327 次点赞,25 条回复,13,162 次浏览,185 次收藏)下方的一条回复中,有人针对 Android 流水线提出希望内置浏览器,这本质上是在要求在同一个 shell 里拥有更完整的工作界面。@notjazii 称赞了(23 次点赞,12 条回复,973 次浏览)支持免费自动审查,因为这能减轻一部分审批负担,而 @realKevinPuray 描述了(4 个赞,4 条回复,227 次浏览)在构建一个名为 Sky 的本地助手,因为 Codex 和 Claude Code 都无法顺畅地批准各自的下一步操作。@msty_ai 已发布(2 个赞,1 条回复,81 次浏览)是一个将会话、文件和审批集中到一处的封装层,体现了部分答案的大致形态。这是务实的一线操作需求,而不是一种带有愿景色彩的期待。机会:直接。

可接入现有工作流的本地与私有代理栈

最强烈的本地优先诉求并非意识形态宣言,而是希望拥有私有工具,同时仍能使用与托管系统相同的接口。@yume_arasaki 提出了观点(7 个赞,3 条回复,267 次浏览,2 次收藏)认为 Strata 之所以重要,是因为它提供了一个与 Anthropic 兼容的 localhost API,Claude Code 和 Codex CLI 都可以直接调用。@NaceAI 发布了(48 个赞,8 条回复,9,830 次浏览,19 次收藏)提到 Drex 1.1 支持 llama.cpp、Ollama 和 Unsloth,而 @PajosTM 将其表述为(5 个赞,1 条回复,165 次浏览)则将 Tabby 视为代码不能离开自有服务器团队的稳妥之选。这个需求很现实,对一些受监管团队来说也很紧迫,而目前只得到部分满足。机会:竞争性。


4. 正在使用的工具与方法

工具 类别 情绪倾向 优势 局限
Antigravity 编码代理 shell (+/-) 官方 Android 从提示到设备的工作流;模型预判能力强;除 Gemini 外也支持 Claude 回复中仍暴露出浏览器和控制界面方面的缺口;旧版 Flash 模型变动频繁;存在数据使用方面的担忧
Codex 编码代理 (+/-) 自动审查现已免费;GPT-6.1-sol 和 Astra 在审查工作流中仍评价很高 反复重置监看仍属常态;桌面端可靠性 bug 已出现;对速度的抱怨依旧存在
Claude Code 编码代理 (+/-) 重度用户仍依赖 Opus/Fable;云会话额度支持后台工作 20x 配额池消耗很快;用户仍会围绕它自行搭建额外的审批辅助工具
OpenCode 编码代理客户端 (+) 模型目录更新很快,例如 Mistral Large 4;价格促销吸引测试 用户会立刻要求提供基准测试以及客户端/平台覆盖情况
Qwen 3.8 Flash with Strata 本地模型 + 引擎 (+) 兼容 Anthropic 的 localhost API;在多个硬件档位上都有明确的 30-160 tok/s 实测回执 所称 32 GB 底线尚未得到经验证回执支撑;在最难的推理任务上,某些基准中仍落后于 Opus
Drex 1.1 决策模型 (+) 开源;可与 llama.cpp、Ollama 和 Unsloth 配合;旨在接入现有 harness 仍属实验性质;回复里立刻有人追问延迟
Tabby 自托管编码助手 (+) 本地部署、私有化;支持多个后端;已有成熟的开源基础 需要团队自行承担部署和运维
Rokha via MCP Registry 工具网络 / 市场 (+/-) 可通过 Copilot 安装并执行工具;每日免费运行次数;明确的开发者分成机制 除了发布与定价文案外,数据集中几乎没有更多技术验证
Msty Go Code Mode 封装层 / 控制平面 (+) 可在多个代理之间将会话、文件、审批和 wiki 状态统一管理 仍处于早期 beta,数据集中看不到更完整的文档
Orca LLM Council 评估方法 (+/-) 盲审同行评议与跨模型汇总评分 token 消耗高,而且至少有一条回复称 GPT 模型会用无关细节干扰 Claude

满意度光谱介于“只要你不断绕开限制,就算够用”和“如果信任比便利更重要,就值得自托管”之间。@notjazii 展示了(23 个赞,12 条回复,973 次浏览)认为,Codex 通过让自动审查免费,改善了一项重要功能的经济性;但 @realKevinPuray 记录了(4 个赞,4 条回复,227 次浏览)展示的,则是一种在 Codex 和 Claude 之间轮换,同时加入 Dots 和本地 Sky 助手来维持审批流转的配置。@opencode 新增了(268 个赞,19 条回复,9,032 次浏览,12 次收藏)很快上线了 Mistral Large 4,但最初几条回复仍在追问与 Opus 的对比以及是否支持 Go。这与前一周是同样的竞争动态:分发速度很重要,但前提是模型已经过基准测试,并且用户的实际客户端能够接入。

更值得注意的迁移模式,是转向可互换的后端和私有化的后备路径。@yume_arasaki 明确关联到(7 个赞,3 条回复,267 次浏览,2 次收藏)将 Qwen 3.8 Flash 接入 Strata,后者暴露出一个与 Anthropic 兼容的 localhost API,这使得从 harness 的视角看,本地模型的行为就像托管模型一样。@NaceAI 将其定位为(48 个赞,8 条回复,9,830 次浏览,19 次收藏)也以同样方式看待 Drex 1.1:它是一个可以嵌入 Claude Code、Codex、Cursor 或 OpenCode 的本地组件。在隐私方面,@PajosTM 将其表述为(5 个赞,1 条回复,165 次浏览)将 Tabby 视为那些代码库不能离开公司服务器时的答案,而 @msty_ai 展示了(2 个赞,1 条回复,(81 次浏览)的一种封装方案,以及 @gabypadronp 展示了(79 次点赞、75 条回复、391 次浏览)都表明,注册表正在变得与其底层模型同样重要。


5. 人们正在构建什么

项目 构建者 功能 解决的问题 技术栈 阶段 链接
Antigravity Android pipeline @antigravity 将提示词和设计稿转化为原生 Android 应用,在模拟器中验证,并在真机上运行 压缩移动端原型从设计到设备交付的流程 Stitch MCP、Android CLI plugin、Jetpack Compose、emulator、real device 已发布 推文(327 次点赞、25 条回复、13,162 次浏览、185 次收藏)
Rokha Network + MCP Registry @gabypadronp 让 Copilot 能从 MCP Registry 安装并运行 Rokha 工具,并通过付费构建者网络路由使用 借助市场激励,让 agent 从只会聊天转向可执行工具 GitHub MCP Registry、Rokha Network、Studio 已发布 推文(79 次点赞、75 条回复、391 次浏览)
Drex 1.1 @NaceAI 一款可置于 agent harness 背后的开源决策模型,能够回答关于上下文的类型化问题 在托管的前沿模型之外增加一层本地、兼容 agent 的决策层 NVIDIA Efficient-DLM-8B base、llama.cpp、Ollama、Unsloth、/v1/systemone endpoint Alpha 代码仓库、推文(48 次点赞、8 条回复、9,830 次浏览、19 次收藏)
Sky approval assistant @realKevinPuray 由 Dots 控制的本地 AI 点击器和审批助手 在 Codex 和 Claude Code 无法自行顺畅处理提示流程时,填补审批环节的空白 Dots、Codex、Claude Code、local workstation Alpha 推文(4 次点赞、4 条回复、227 次浏览)
LLM Council for design reviews @JinjingLiang 编排多个前沿模型审查同一任务、彼此匿名打分,并汇总投票结果 提供一种可重复的方法,用于比较不同模型在编码/研究上的质量 Orca Build orchestrator、Sonnet 5 president、GPT-6.1-sol、GPT-6-astra、Opus、Fable Alpha 推文(11 次点赞、3 条回复、278 次浏览、4 次收藏)
Msty Go Code Mode @msty_ai 在一个桌面界面中封装现有编码 agent,提供共享会话、文件、审批和 wiki 状态 在多个 agent 后端之间集中管理上下文与控制 Msty Go、Codex、Claude、Cursor、OpenCode、Grok Build、Pi Beta 推文(2 次点赞、1 条回复、81 次浏览)
Semantic Web Agent skill @kidehen 展示一个由 Codex 安装的 skill,可对 DBpedia 进行推理并返回带来源依据的答案 将编码 agent 扩展到语义网和本体工作流 Codex、DBpedia、RDF/OWL/SPARQL skill、ROBOT、FuXi、riot Alpha 代码仓库、推文(70 次浏览、1 次收藏)
Tabby TabbyML 一款自托管 AI 编码助手,带有编辑器集成和多种后端选项 让代码保留在公司可控的基础设施内 Rust、on-prem deployment、VS Code 和 JetBrains extensions、多种 LLM backends 已发布 代码仓库、推文(5 次点赞、1 条回复、165 次浏览、1 次收藏)

@antigravity 演示了(327 次点赞、25 条回复、13,162 次浏览、185 次收藏)是这组项目中最完整的已发布工作流:一条贯穿设计导入、代码生成、模拟器测试和真机运行的移动端流水线。@gabypadronp 新增了(79 个赞、75 条回复、391 次浏览)这是围绕 agent 执行最清晰的商业模式:发布一个 rig 后,只要其他用户通过 Rokha 的网络运行它,就能产生收入。

@JinjingLiang 使用了(11 个赞、3 条回复、278 次浏览、4 次收藏)Orca 的内置编排器可用来构建一个 LLM Council,让多个模型审阅同一项工作、在盲评条件下互相打分,并汇总出最终结论。附带的表格信息量很大,因为它展示的是工作流的结构及其产出,而不只是作者对哪个模型胜出的个人判断。

LLM Council 评审表:比较 Codex 与 Claude Code 模型运行在总体得分、准确性、深度、严重性校准、原创性和信任投票等方面的表现

@FareaNFts 总结了(2 个赞、1,179 次浏览、2 次收藏)这是另一类 builder 故事:围绕 Hermes 形成的服务经济。帖子列举了小企业部署、相互隔离的客户配置、低成本硬件部署、Hermes、Claude Code 和 Cursor 之间的共享内存设置,以及 agent 出错后的简单回滚模式。这一点很重要,因为它表明,多个人正各自独立地把同一种 agent 底层能力做成收费的、处理枯燥工作的自动化方案,而不是做成演示。

Hermes 用例拼贴图,涵盖小型企业部署、家庭助手、GitHub 集成、消息工作流、摘要及其他高频自动化场景

@kidehen 展示了(70 次浏览、1 次收藏)Codex 安装了一项语义网技能,并使用 DBpedia 返回带有来源依据的推断答案。链接的仓库称,这项技能可处理 RDF、OWL、N3、RIF 和 SPARQL 工作流,并使用 ROBOT、FuXi 和 riot 等工具,因此它很好地说明了技能层正在变得面向特定领域,而不再只是通用能力。

分步语义网技能流程图,展示 Codex、已安装技能与 DBpedia 如何协作,并结合溯源信息回答实时蕴含查询

这些项目中,触发构建的常见因素相当一致:审批摩擦、每天重复的琐事、安装部署不便,以及需要在多个运行时之间迁移同一种 agent 行为。值得注意的模式是,许多 builder 并没有发明新的基础模型,而是在对现有模型做封装、路由、评估或专门化,让这些系统适配真实工作流。


6. 新的重点动态

加密上下文注入为 Copilot CLI 提供了一条具体的数据外传路径

@The_Cyber_News 报道称(22 个赞、1 条回复、1,976 次浏览)称,一条 Cryptographic Context Injection 攻击链可能让处于 autopilot review 模式的 Copilot CLI 审查外部页面、解密隐藏指令、读取本地文件,并将其内容外传。链接文章称,Adversa AI 观察到一个本地 .env.prod 文件在 28 秒内被传输出去;而 The Register 的佐证报道则称,一个受测的 mai-code-1.1-flash 配置有一半尝试执行了完整攻击链,而两个 GPT-5.6 变体则拒绝执行。这一点之所以重要,是因为它把 coding-agent 的提示注入从理论问题推进成了一个 shell 层面的数据暴露案例,而且结果还取决于具体模型。

Pwn2Own 把针对 Codex 的参数注入变成了赢得奖金的漏洞利用

@thezdi 确认了(11 个赞、2,181 次浏览、2 次收藏、2 次引用)称,Ikotas Labs 在 Pwn2Own 上利用一个单一的参数注入漏洞攻击了 OpenAI Codex,并赢得了 40,000 美元以及 4 个 Master of Pwn 积分。其意义不仅在于 Codex 可以被利用,更在于 agent 专属攻击面如今已经重要到足以出现在主流攻防研究活动中,而不再只存在于社交媒体的争论串里。

Codex 桌面版崩溃循环报告显示,可靠性债务可能昂贵到什么程度

@nim_chimpsky_ 指出(1 个赞、190 次浏览)指向一个 GitHub issue,描述了 macOS 上的 browser_crashpad_handler 循环,据称曾让一台系统累计产生 511 GB 的 minidump。该 issue 的评论没有削弱这一说法,反而增加了更多证据,包括另外两份报告,分别称累计了约 180 GB 和 246.8 GB,之后一位 OpenAI 工程师回复称,针对旧版 mac 内核的修复已合并。这里的重要信号是,agent 可靠性失效的代价已不再只是一次糟糕的运行或一个错误答案;它可能升级为磁盘和运维层面的事故。


7. 机会在哪里

[+++] Quota-aware control planes for agent work — The most repeated pain was not "which model is smartest?" but "which surface still has headroom?" @realKevinPuray 描述(4 个赞、4 条回复、227 次浏览)在 Codex、Claude、Dots 和一个本地助手之间轮换;@codex_resets 展示(77 个赞、4 条回复、13,181 次浏览、14 次收藏)表明,重置计时已经变成用户会在外部追踪的东西;而 @StefanoGPT 询问(2 个赞、3 条回复、708 次浏览)则指向仅限 Codex 的套餐。这个机会很大,因为痛点直接、反复出现,而且代价高昂。

[++] Supervised autonomy that reduces approval fatigue without going fully blind — @notjazii 庆祝(23 个赞、12 条回复、973 次浏览)之所以提供免费自动审查,正是因为完全依赖人工审批太过耗费精力;在 @antigravity 展示(327 个赞、25 条回复、13,162 次浏览、185 次收藏)下的一条回复中,Android 流水线提出需要内置浏览器;而 @msty_ai 已发货(2 个赞、1 条回复、81 次浏览)则提到一个集中管理文件和审批的封装层。这是一个中等机会,因为多款产品正收敛到同一种答案,但似乎还没有一家真正完成闭环。

[++] Private and local agent infrastructure with drop-in compatibility — @TimJayas 提出(26 个赞、3 条回复、1,687 次浏览)提出了 Antigravity 中围绕 Claude 的明确数据使用顾虑,@The_Cyber_News 报道(22 个赞、1 条回复、1,976 次浏览)提到一条 Copilot CLI 数据外泄链,@PajosTM 推广(5 个赞、1 条回复、165 次浏览)将 Tabby 作为自托管方案,而 @yume_arasaki 展示(7 个赞、3 条回复、267 次浏览、2 次收藏)则解释了为什么兼容 Anthropic 的 localhost API 很重要。这个机会属中等,因为需求真实存在,但买方范围更窄,对运营能力的要求也更高。

[+] Registry-native skills and service-marketplace layers — @RoundtableSpace 重点介绍(54 个赞、9 条回复、41,937 次浏览、53 次收藏)一个跨代理技能索引,@gabypadronp 介绍(79 次点赞、75 条回复、391 次浏览)讨论了围绕可通过注册表安装的工具网络的定价与收入分成,而 @FareaNFts 指出(2 次点赞、1,179 次浏览、2 次收藏)则面向已经通过 Hermes 安装和托管自动化实现变现的人群。之所以会出现这一机会,是因为分发与变现已经清晰可见,但标准化和技术信任仍处于早期阶段。


8. 要点

  1. Antigravity 的下一阶段将由具体的产品落地来评判,而不只是看预告式措辞。 @antigravity 展示(327 次点赞、25 条回复、13,162 次浏览、185 次收藏)展示了一个从提示词到手机的 Android 工作流;@thtbee_ 拍摄(284 次点赞、13 条回复、11,715 次浏览、14 次收藏)指向 Gemini 3.6 和 3.7 Flash 的实际下线;@HarshithLucky3 发现(139 次点赞、17 条回复、20,607 次浏览、26 次收藏)则显示了升级流程中与 Argon 相关的线索。
  2. Agent 套餐的经济性仍在迫使人们采取路由策略。 @notjazii 欢迎(23 次点赞、12 条回复、973 次浏览)提到免费自动审查,@codex_resets 转向(77 次点赞、4 条回复、13,181 次浏览、14 次收藏)提到重置后变成了一个观察网站,而 @realKevinPuray 记录(4 次点赞、4 条回复、227 次浏览)则提到了一种通过轮换订阅来维持高强度编码的工作流。
  3. 围绕 agents 的封装层正逐渐固化为产品结构。 @RoundtableSpace 重点介绍(54 次点赞、9 条回复、41,937 次浏览、53 次收藏)展示了一个跨 agent 的技能索引,@gabypadronp 介绍(79 个赞、75 条回复、391 次浏览)讨论了围绕可通过注册表安装的工具网络的定价与分成机制,以及 @msty_ai 已发货(2 个赞、1 条回复、81 次浏览)提到的一个位于多个后端之上的封装式 UI。
  4. 本地和私有化替代方案之所以开始站稳脚跟,是因为它们在模仿托管式界面,而不是排斥这种形态。 @yume_arasaki 主张(7 个赞、3 条回复、267 次浏览、2 次收藏)认为 Strata 之所以重要,是因为它提供了一个兼容 Anthropic 的 localhost API;@NaceAI 发布(48 个赞、8 条回复、9,830 次浏览、19 次收藏)提到面向多个本地运行器的 Drex 1.1;以及 @PajosTM 推介(5 个赞、1 条回复、165 次浏览、1 次收藏)将 Tabby 视为敏感代码库的自托管答案。
  5. 如今,在评估工具时,安全性和可靠性方面的欠账已与能力本身并列。 @The_Cyber_News 报道(22 个赞、1 条回复、1,976 次浏览)提到一条 Copilot CLI 数据外泄链,@thezdi 确认(11 个赞、2,181 次浏览、2 次收藏、2 次引用)提到一个在 Pwn2Own 上获奖的 Codex 漏洞利用,以及 @nim_chimpsky_ 出现(1 个赞、190 次浏览)提到一次 Codex 桌面版崩溃循环,据称生成了数百 GB 的转储文件。