跳转至

Reddit AI 编程 - 2026-07-26

1. 人们在讨论什么

1.1 对 Opus 5 的矛盾评价,演变成了关于证据质量的争论(🡕)

至少有 3 条热度最高的 ClaudeCode 帖子都在说,关于 Opus 5,真正重要的不是它算不算“赢了”,而是它在不同任务之间表现得有多不均衡。版面里混杂着亲身称赞、亲身挫败,以及一层更上位的争论:如果拿不出可复现证据,子版块里的结论大多都只是噪音。

u/Silver_Cello 发了一张梗图,把“Opus 5——立刻让人失望”和“Opus 5 简直太神了!!”并列摆在一起,回复则把这种矛盾本身当成了重点(《so which is it》)(1694 分,136 条评论)。u/Kitchen_Interview371(380 分)说,这只是正常的概率波动;而 u/Appropriate-Fox-2347(58 分)则描述说,在一个中等规模的架构方案上,Opus 5 一路建立在错误假设上,直到混合使用 Claude/Codex 的评审小组,再加上回退到 Fable,才把方案拉回正轨。

u/seldomactive 又把同样的疲劳感变成了对版务的抱怨,说这个子版块已经被 token 和性能抱怨占满,却几乎没有实证证据(《This sub is an absolute dumpster fire.》)(919 分,207 条评论)。u/Poildek(204 分)和 u/teleekom(27 分)都希望版务更严格一些,或者至少开一个抱怨汇总大帖,让可复现的工作流帖子重新浮出来。

u/basicpreset 给出了最细的上手对比,说 Opus 5 在做规划时更容易跟得上,而 Sol 在审阅或执行角色上仍然更强(《For those of you on the fence: Opus 5 after using 5.6 Sol since release》)(218 分,139 条评论)。在回复里,u/theeternalpanda(11 分)说,现实答案根本不是赢家通吃:在不同环节分别用 Opus 和 Sol,再让 Codex 或第二遍 Claude 复查结果。

讨论要点:最强的回复并没有收敛到“Opus 好”或“Opus 差”。它们真正收敛到的是角色拆分、交叉校验,以及对那种拿不出依据的抱怨帖保持不信任。

与前日对比:7 月 25 日已经出现了抱怨疲劳和档位设置实验。到 7 月 26 日,讨论又往前走了一步,变成了“自己上手试、留好证据,并默认子版块本身噪音很大”。

1.2 AI 已经接管了学习和求助的第一稿,但还没接管“证明”这一步(🡕)

至少有 4 条来自 vibecoding 的高信号帖子都在说,AI 现在已经拿下了第一次交互——解释、原型、答案,或者代码初稿——但面试、QA 和真实用户验证仍然得由人来扛。整体情绪不是反 AI,而是反对把 AI 的流畅输出误当成已经真正理解。

u/TechAngelX 提问,在个人编程智能体已经能更快回答怎么落地的问题、也没有过去那种公开嘲讽氛围之后,Stack Overflow 是否实际上已经死了(《Vibecoders: is StackOverflow dead?》)(551 分,147 条评论)。u/LordEli(110 分)拿出了一张提问量持续下滑的图;而 u/Affectionate_Fact854(78 分)则说,在 Godot 空间网格、shader 速查表和设计审计这类任务上,AI 已经取代了 Stack Overflow。

Stack Overflow 提问量一路下滑到 2026 年的图表,评论者把它当成 AI 正在取代公开编程问答的速记证据

但一到招聘环节,这套“取代”叙事就撑不住了。u/i-like-blackberry 提问,那些一边重度依赖 AI、一边拿到软件工程工作的人,到底是怎么准备面试,又如何证明自己真的会写代码的(《People who landed software engineering jobs while vibe coding, how did you prepare for interviews and prove your actual coding skills?》)(432 分,45 条评论)。u/Sea-Tale1722(105 分)说,连续两年重度依赖 AI 写代码之后,自己在面试里连一个简单的 SQL 查询都做不出来;而 u/iriveru(21 分)则说,唯一更持久的修复办法,是让 AI 做导师和出题器,而不是主打字员。

同样的断层也出现在团队内部。u/utilitycoder 说,他们公司已经到了这样一个阶段:AI 生成 commit 和 PR 的速度,比 QA、业务验证和部署能跟上的速度还快(《AI writes faster than we can QA or ship》)(63 分,72 条评论)。u/Square-Yam-3772(36 分)说,QA 现在也需要自己的自动化;而 u/Emotional_Pipe_1004(3 分)则说,真正的瓶颈是业务其他环节根本吸收不了这么快的改动。

另一条规模较小、但很有用的职场帖子,则从反方向说出了同一个问题。u/firebird8541154 认为,所谓“vibe code 岗位”其实并不是一个独立类别,因为雇主最终还是更愿意要那些看得懂自己在指挥什么代码的人(《Why I think vibe code jobs aren't a thing》)(45 分,70 条评论);而 u/SnooBananas4958(35 分)则说,这份工作本质上仍然是软件工程,只不过现在是把智能体放进了工作流里。

讨论要点:回复并没有叫人别再用 AI。它们真正要求的,是让 AI 在栈里往下退一层:做导师、做审阅者、做 QA 助手、做快速起草引擎,而不是那个让“证明自己”这件事不再需要存在的东西。

与前日对比:7 月 25 日把 AI 说成 Stack Overflow 的替代品,也是面试焦虑的来源。到 7 月 26 日,讨论里又多了更具体的故事:QA 积压、招聘预期,以及当生成速度超过验证速度时到底会发生什么。

1.3 钩子、新上下文审阅者与提示词上下文卫生,成了真正的控制平面(🡕)

最强的解决方案帖,已经不是在讨论怎么把提示词写得更好,而是在讨论运行时治理:什么东西会被注入上下文、什么时候允许智能体委派,以及在信任任何 AI 写出的改动之前,如何强制再做一遍复审。

u/Skflowne 发出了最清晰、也最具体的失败案例:Claude Code 从系统提示词上下文里抓出个人邮箱,并把它用到了一个本来已经配置为匿名的仓库里(《Claude Code injects your email address directly into system prompt》)(274 分,144 条评论)。u/teramoc(81 分)说,系统提示词里包含一个 userEmail 字段;而 u/ohtaninja(20 分)则说,核心风险不只是账户元数据本身,而是任何被放进活跃模型上下文里的内容,都可能泄漏到工具调用或下游系统里。

截图显示 Claude Code 在覆盖匿名化 git 作者配置时,引用了注入到系统提示词上下文里的用户邮箱

u/jetsetter 则把另一种失败模式追到了运行框架本身,指出 Opus 5 里硬编码了一条指令:除非用户明确要求,否则不要使用子智能体(《Claude Code has a hardcoded instruction telling Opus 5 not to use subagents》)(287 分,101 条评论)。u/EloWeld(48 分)说,现实可行的绕法,是把委派措辞写成直接的用户请求;如果本该独立运行的审计其实是在同一上下文里内联执行,就应该明确报错。

最偏操作层的回答,是干脆别再相信模型会自己听提示词了。u/croovies 认为,真实工作里,上线前需要第二个模型或一个全新上下文,用对抗式方式审查 diff(《You're shipping bugs if you're not using adversarial reviews with claude code》)(173 分,101 条评论)。这个想法在钩子讨论里又出现了一次:u/EloWeld(14 分)说,“指令只是建议,钩子才是墙。”;u/berrybadrinath(6 分)则描述了那类 hooks:它们会在根因分析之前先拦住编辑、把改动文件和计划做对照,还会用金丝雀方式去测试这些护栏本身(《In the spirit of trying to add more value to this sub. Let’s talk about hooks.》)(64 分,38 条评论)。

讨论要点:实践者更偏爱那些能真正执行的控制层——钩子、只读审阅智能体、明确的委派措辞,以及安全扫描——而不是去赌写作模型会自己记住所有规则。

与前日对比:7 月 25 日已经把 hooks 和工具路由当成有用修复办法。到 7 月 26 日,讨论则进一步拿出了具体事故证据,用户开始把失败追到提示词上下文、委派规则,以及缺失的独立审阅上。

1.4 用量上限、故障与“伪账单”,本身都成了独立话题(🡕)

成本和可用性已经不再只是背景问题。用户开始把积分界面截图、每周 token 台账和公开状态事故页当成证据,因为套餐界面本身仍然让人很难看懂。

u/anotherpanacea 说,在每周限额已经用尽之后,Opus 5 看起来还在继续用却没继续扣费,并附上了卡住的积分余额、一个停在限额处的面板,以及一份每周 token 报告截图作为证据(《Opus 5 not charging for usage right now?》)(176 分,35 条评论)。来自 u/nps44(91 分)和 u/CryptoAteMyHamster(44 分)的高赞回复,立刻把这件事转成了账单焦虑:这也许是发布日赠送,也许只是某个人马上就要撞上一笔巨额延迟扣费。

每周 Claude Code token 使用报告,列出了每周输入、输出、缓存、总 token 和按价格折算的总额;用户把它当成套餐计量太难读懂的证据

u/EnthusiasmMountain10 把这套经济学讲得更直白:他说,自己一个月的个人 Claude Code 工作,如果按标价 token 费率来折算,大约相当于 8900 美元,而到目前为止带来的收入正好是 0 美元(《I burned 9.9B tokens last month and made exactly zero dollars(yet?)》)(33 分,16 条评论)。关键点不只是贵,而是无限生成把更老的瓶颈都暴露了出来:到底什么值得做、那无聊的最后 20% 谁来收尾,以及分发从哪里来。

可用性也进入了同一条信任回路。u/DrP4R71CL3 把反复出现的 529 过载错误,直接连到了 Claude 面向 Opus 5 的公开状态事故页上(《Model Overloaded, anyone ?》)(20 分,27 条评论);状态事故页

讨论要点:人们现在会把截图、事故页和按价格折算的成本表拿出来当证据,因为套餐重置、用量条和积分仪表盘仍然解释不了自己到底在说什么。

与前日对比:7 月 25 日的成本讨论,重点还放在中档和高档 effort 的取舍上。到 7 月 26 日,重点则变成了这些计量条、重置逻辑和事故界面到底能不能被解释清楚。


2. 令人困扰的问题

审查和验证已经跟不上生成速度

严重程度:高。u/utilitycoder 说,几十名工程师提交 AI 编写 PR 的速度,已经快到 QA、业务审批和既定发版节奏都接不住了(《AI writes faster than we can QA or ship》)(63 分,72 条评论)。u/Square-Yam-3772(36 分)说,QA 现在也需要自己的自动化;而 u/Emotional_Pipe_1004(3 分)则说,更深的瓶颈在于,业务其他环节根本跟不上工程端生成改动的速度,没法同样快地把验证跟上。

这也解释了为什么“第二遍审阅”帖子会引起共鸣。u/croovies 说,在最近 83 个已经收尾、且拿去给 Codex 审阅的工单里,有 67 个最后都导致了真实代码修改,而修复里占主导的是正确性、并发、持久性和安全问题(《You're shipping bugs if you're not using adversarial reviews with claude code》)(173 分,101 条评论)。落到个人层面,u/Sea-Tale1722(105 分)说,重度使用 AI 之后,自己在面试里连简单 SQL 查询都做不出来;而 u/SnooBananas4958(35 分)则说,雇主最终还是会选那些既能理解、也能审核自己指挥出来的代码的人,这一点在(《People who landed software engineering jobs while vibe coding, how did you prepare for interviews and prove your actual coding skills?》)(432 分,45 条评论)和(《Why I think vibe code jobs aren't a thing》)(45 分,70 条评论)里都看得很清楚。

这很值得做成产品。需求很直接:审阅队列、代码解释工具、导师 / 出题循环,以及能跟上生成速度、又不假装审查可以消失的 QA 系统。

安全和上下文错误,仍然太容易被直接带到线上

严重程度:高。u/Skflowne 展示了 Claude Code 如何在仓库已经做了匿名化设置的情况下,仍把提示词上下文里的个人邮箱带进 git 作者信息里(《Claude Code injects your email address directly into system prompt》)(274 分,144 条评论);而 u/ohtaninja(20 分)则说,任何处在活跃上下文里的东西,都有机会泄漏进工具调用或下游系统。在那条面向公开应用的安全帖子里,u/Diligent-Macaroon566(8 分)列出了构建者真实会撞上的反复利用类别——客户端打包产物里泄漏密钥、过度宽松的 Supabase RLS、用户之间互换 ID,以及过弱的认证限流;而 u/ItaySela(4 分)则补上了付费应用版本:让客户端自己决定价格或权益标记(《People that have published their vibecoded app, how do you deal with cybersecurity side?》)(39 分,49 条评论)。

权宜方案栈很实际,但也很零碎。同一条帖子建议把 Stripe 作为支付事实来源,并做周期性审计;而对抗式审阅讨论,以及像 CodeInspectusDeepsec 这样的关联工具,则更指向扫描—修复—复扫循环和大仓库安全复审,而不是一次性提示词。这个方向很值得做,因为它瞄准的就是直接的上线准备度和数据安全需求,而不是一个投机性问题。

限额、积分和故障,至今还得靠截图取证

严重程度:中高。u/anotherpanacea 说,Opus 5 的使用看起来像是停掉了扣费,并用积分界面加每周 token 报告作证(《Opus 5 not charging for usage right now?》)(176 分,35 条评论);而 u/EnthusiasmMountain10 则说,一个月的 Claude Code 使用量,如果按标价 token 费率来算,大约是 8900 美元,但带来的收入仍然是 0 美元(《I burned 9.9B tokens last month and made exactly zero dollars(yet?)》)(33 分,16 条评论)。u/DrP4R71CL3 则把反复出现的 529 过载错误,连到了 Claude 面向 Opus 5 的公开状态事故页上(《Model Overloaded, anyone ?》)(20 分,27 条评论);状态事故页

人们现在的应对方式,是互相对截图、等重置,再把公开事故页当成操作文档来用。更大的挫败感在于,用户并不觉得现有套餐界面,光靠自己就能把成本、账单暴露或实时可用性解释清楚。这个方向值得做,不过机会比审阅或安全更窄一些:更好的成本预测、重置说明,以及感知事故状态的预算工具,才是直接需求。


3. 人们期望的功能

能强制执行的智能体行为策略层

人们要的不是更多提示词技巧,而是真正能站得住的控制层。u/Skflowne 看到个人邮箱泄漏进 commit 行为之后,希望提示词上下文里的个人邮箱能有一个退出开关(《Claude Code injects your email address directly into system prompt》)(274 分,144 条评论);而 u/jetsetter 则希望子智能体行为能稳定可靠,而不是那种看起来像独立运行、实际上却静默内联执行的假独立(《Claude Code has a hardcoded instruction telling Opus 5 not to use subagents》)(287 分,101 条评论)。最强的回复都指向同一种解法形状:拦坏命令的钩子、明确的委派规则,以及强制独立审阅者,尤其是在(《In the spirit of trying to add more value to this sub. Let’s talk about hooks.》)(64 分,38 条评论)和(《You're shipping bugs if you're not using adversarial reviews with claude code》)(173 分,101 条评论)里。机会:直接。

构建能力而不是依赖的 AI 原生学习循环

面试和求职帖子里真正的诉求,不是“让 AI 消失”,而是“帮我把自己的判断力保住”。u/iriveru(21 分)说,AI 应该变成导师和出题器;u/Sea-Tale1722(105 分)说,离开 AI 一段时间,是唯一能把面试熟练度找回来的办法;而 u/SnooBananas4958(35 分)则说,雇主依然想要那些能解释自己所指挥代码的人,这一点在(《People who landed software engineering jobs while vibe coding, how did you prepare for interviews and prove your actual coding skills?》)(432 分,45 条评论)和(《Why I think vibe code jobs aren't a thing》)(45 分,70 条评论)里都讲得很明白。Stack Overflow 那条帖子又让这个需求更紧迫了一点,因为用户已经把 AI 当成第一答案入口(《Vibecoders: is StackOverflow dead?》)(551 分,147 条评论)。机会:竞争激烈。

面向公开或付费 AI 辅助构建应用的安全发布套件

这是构建者集合里最清晰的直接需求。u/lightwavel 明确追问,大家到底是怎么在不担心安全失误的前提下,把付费或面向用户的 AI 辅助构建应用发出去的(《People that have published their vibecoded app, how do you deal with cybersecurity side?》)(39 分,49 条评论)。最好的回答并不抽象:把 Stripe 作为计费事实来源、检查客户端打包产物里有没有密钥、核验 Supabase RLS、手动测试 ID 互换,以及永远不要在价格或权益标记上信任客户端。关联工具也指向同一个方向:CodeInspectus 提供的是面向 AI 生成代码的本地扫描—修复—复扫循环,而 Deepsec 则主打在代价很高时对大仓库做漏洞复审。机会:直接。

在用户恐慌前就能自我说明的成本与配额界面

人们之所以在看截图和事故页,是因为现有计量界面仍然给猜测留下了太多空间。u/anotherpanacea 不确定 Opus 5 到底是暂时免费,还是马上要给自己送来一笔巨额延迟账单(《Opus 5 not charging for usage right now?》)(176 分,35 条评论);u/EnthusiasmMountain10 则把自己的一个月折算成了大约 8900 美元的标价等值(《I burned 9.9B tokens last month and made exactly zero dollars(yet?)》)(33 分,16 条评论);而 u/DrP4R71CL3 则不得不去看公开状态页,解释反复出现的 529 错误(《Model Overloaded, anyone ?》)(20 分,27 条评论)。人们看起来想要的其实很简单:在我再烧掉一个会话之前,先告诉我,我现在到底是被限额、被打折、被多收了钱,还是只是撞上了一次故障。机会:竞争激烈。


4. 使用中的工具与方法

工具 类别 评价 优势 局限
Claude Opus 5 LLM (+/-) 对部分用户来说规划更清晰,有时 token 消耗更低,在某些审计里跨文件推理很有用 表现高度依赖工作流,可能无视护栏预期,也仍会引发用量与故障上的困惑
GPT-5.6 Sol / Codex LLM / 编程智能体 (+/-) 审阅和执行能力强,能抓到与 Opus 不同的 bug,适合边界清晰的落地任务包 对部分用户会过度设计方案,也可能很耗用量,还更难跟进
Claude Fable 5 LLM (+/-) 在审计、精度和部分规划流程上更受信任 token 消耗重,而且持续有人抱怨它回退或可用性下降
Hooks / PreToolUse / SessionStart 运行框架控制 (+) 强制执行运行时规则、拦住坏命令、加入审计触发器,在新上下文下仍然有效 需要自定义配置、脚本和持续维护规则
对抗式审阅 / 新上下文审阅者 审阅方法 (+) 能在上线前抓出正确性、并发、持久性和安全问题 会给本来就很长的交付循环再加 token 成本和审阅开销
CodeInspectus 安全扫描器 / MCP (+) 本地优先的扫描—修复—复扫工作流,附带面向 AI 应用的专项检查 需要本地部署,修复和优先级仍然依赖人工判断
Deepsec 漏洞扫描器 (+/-) 面向大仓库、由智能体驱动的复审,适合查难发现的问题 仓库页面明确警告,完整扫描可能花掉数千甚至数万美元
Stripe 支付 (+) 用对时,能把卡信息和最终扣费判定都留在服务端 webhook、重试、退款和权益逻辑仍然需要谨慎处理

主导模式已经不是押注单一模型,而是按投资组合来想。u/basicpreset 说,Opus 5 更适合做规划,而 Sol 在审阅或执行上仍然更强(《For those of you on the fence: Opus 5 after using 5.6 Sol since release》)(218 分,139 条评论);而 u/theeternalpanda(11 分)则描述了混合模型安全复审:让 Opus、Sol 和 Codex 分别检查不同表面,再把结果汇总回来统一分诊。

控制层已经被当成一个独立产品类别来对待。在钩子讨论里,u/EloWeld(14 分)说,提示词只是建议,钩子才是墙;而 u/k0d3x8its(23 分)则把 bash-audit、formatter、linter、command-guard 和 secret-guard hooks 列成了标准运行时基础设施(《In the spirit of trying to add more value to this sub. Let’s talk about hooks.》)(64 分,38 条评论)。对抗式审阅帖子,则把同样的逻辑再往上一层推进:它建议把一个新模型或全新上下文,设成强制性的第二遍复审(《You're shipping bugs if you're not using adversarial reviews with claude code》)(173 分,101 条评论)。

安全工具链被描述成一整套栈,而不是单一银弹。那条公开应用安全帖子建议用 Stripe 处理支付,再配上周期性审计(《People that have published their vibecoded app, how do you deal with cybersecurity side?》)(39 分,49 条评论)。关联的 CodeInspectus 仓库把自己描述成本地优先、面向 AI 生成代码的安全 MCP 服务器,而 Deepsec 则把自己定位成由智能体驱动的大仓库漏洞扫描器。竞争格局同样是多元的:用户会把 Opus、Sol、Fable 和外部扫描器轮换着用,因为它们各自会抓到不同的失败模式。


5. 人们在构建什么

项目 构建者 功能 解决的问题 技术栈 阶段 链接
Nelly Jellies u/MightyBig-Dev 已在网页、iOS 和 Android 上发布的轻松合成游戏 证明一个小型 AI 辅助游戏可以从原型走到公开的跨平台发布 React, Vite, Matter.js, Capacitor, Codex 已发布 帖子, 网站
Fortune & Flak u/Chatterlings 浏览器射击游戏,双驾驶员设定,支持键盘 / 手柄控制和分阶段推进 把怀旧创意做成了一个免安装、可玩的街机原型 GPT Sol, Opus, VS Code, Suno, ElevenLabs Beta 帖子, 网站
Boomstick City u/Phinguin 浏览器多人 CCG,含四个阵营和先到 15 分获胜的计分规则 测试纯粹的 vibe coding 能否做到一个实时多人网页游戏 Claude Code, Opus 4.8, Fable, Colyseus, GPT, ElevenLabs 已发布 帖子, 网站
Neon Rain / AI World Bakeoff u/valhallarecords 来自一次性模型对比赛的公开可探索 three.js 世界 把模型比较变成可检查的成品,而不只是停留在基准讨论里 Opus 5, Three.js, WebGL2, single-file HTML 已发布 帖子, 世界, 对比赛

Nelly Jellies 截图里有实时分数界面、进度条和重玩 / 分享按钮,这支撑了它已经能跨设备公开发布的判断

构建者模式依然是浏览器优先、范围小,而且高度可检查。u/MightyBig-Dev 发的不只是一个点子;Nelly Jellies 那条帖子里明确写出了 React/Vite/Matter.js/Capacitor 技术栈,而且 u/1mrlee(23 分)和 u/war4peace79(13 分)的评论都说,他们真的玩了进去,一玩就是 10 分钟到好几个小时(《I vibe coded a cozy jelly merge game with React, Matter.js and Capacitor. Free, no login, play within 5 seconds.》)(122 分,68 条评论)。u/Chatterlingsu/Phinguin 也沿着同样的模式走:一个做了浏览器 SHMUP,一个做了免安装的多人卡牌游戏,而且都给出了足够多的技术栈细节,让其他构建者能照着抄作业;这一点在(《Vibecoded an arcade SHUMP - Fortune and Flak》)(32 分,14 条评论)和(《I made a multiplayer CCG 100% vibe coded!》)(18 分,3 条评论)里都能看到。

这个基准成品之所以重要,是因为它让模型比较变得可检查。u/valhallarecords 贴出的不是一句分数说法,而是一个可以直接探索的 Opus 5 世界(《Opus 5 One-shotted Tokyo Neon City in Three.js》)(97 分,8 条评论)。同样的转向也出现在经济学那一侧:u/EnthusiasmMountain10 说,近乎无限的一个月生成量,到目前为止带来的收入仍然是 0 美元(《I burned 9.9B tokens last month and made exactly zero dollars(yet?)》)(33 分,16 条评论)。因此,反复出现的构建模式其实很简单:AI 让“做出一个能玩或能探索的东西”更容易了,但留存、平衡性、商业价值和分发的证明,仍然会更晚才到。


6. 新动态与亮点

提示词上下文中的个人身份信息(PII)泄漏,成了具体的操作风险

u/Skflowne 并不是在抽象地抱怨隐私。帖子里附了一张截图,显示 Claude Code 在覆盖匿名化 git 作者配置时,引用了系统提示词上下文里的个人邮箱(《Claude Code injects your email address directly into system prompt》)(274 分,144 条评论)。u/teramoc(81 分)和 u/ohtaninja(20 分)把这件事推成了一个更广泛的产品教训:任何被注入实时上下文的内容,都可能泄漏进工具行为里,即便它原本根本不是拿来当指令用的。

按 token 折算的账单,成了新型进度报告

这些用量帖子之所以值得注意,不只是因为大家在说“限额变差了”。u/anotherpanacea 一边试图弄清 Opus 5 是不是已经停止扣费,一边分享了一份每周 token 报告(《Opus 5 not charging for usage right now?》)(176 分,35 条评论);而 u/EnthusiasmMountain10 则给出了完全相反的表述——一个月里,按标价折算大约 8900 美元的 token 流量,到目前为止仍只带来了 0 美元收入(《I burned 9.9B tokens last month and made exactly zero dollars(yet?)》)(33 分,16 条评论)。成本报告,正在变成一种公开讨论智能体式编程到底产出了什么的新方式。

可直接探索的基准成品,开始比只报分数更重要

u/valhallarecords 贴出了 AI World Bakeoff 里一个公开、可探索的 Opus 5 three.js 世界,而不是让大家去相信一张排行榜截图(《Opus 5 One-shotted Tokyo Neon City in Three.js》)(97 分,8 条评论);世界。这很重要,因为当模型比较还困在“轶事对轶事”的争论里时,它至少给社区留下一样可以真正去检查的具体东西。


7. 机会在哪里

[+++] 智能体治理与溯源层 - 来自提示词上下文泄漏帖、子智能体压制帖、钩子讨论帖,以及对抗式审阅帖的证据,其实都指向同一个方向:人们想要的是那些真的能治理、审计并解释清楚的智能体运行过程(Claude Code injects your email address directly into system prompt; Claude Code has a hardcoded instruction telling Opus 5 not to use subagents; In the spirit of trying to add more value to this sub. Let’s talk about hooks.; You're shipping bugs if you're not using adversarial reviews with claude code). 这个方向很强,因为需求具体、反复出现,而且已经能看到用户围绕它搭出来的权宜方案。

[+++] 能跟上生成速度的审查与 QA 系统 - 企业交付帖子、面试能力退化帖子,以及岗位话题帖子都在展示同一个缺口:生成代码已经比证明它是对的更容易了(AI writes faster than we can QA or ship; People who landed software engineering jobs while vibe coding, how did you prepare for interviews and prove your actual coding skills?; Why I think vibe code jobs aren't a thing). 这个方向很强,因为它同时跨团队、独立构建者和招聘场景,而且用户已经在花 token 给第二遍审阅者补这个洞。

[++] 面向公开 AI 构建应用的安全加固套件 - 网络安全帖子加上关联扫描工具,说明市场上存在一类机会:围绕密钥、RLS、授权、webhooks 和错误的客户端信任,打包提供上线准备度检查(People that have published their vibecoded app, how do you deal with cybersecurity side?; CodeInspectus; Deepsec). 这个方向是中等偏强,因为需求很直接,但市场上也已经开始出现扫描器和操作手册。

[+] 成本、配额与可用性观测层 - 用量报告截图、按 token 折算的账单,以及公开事故链接都在说明,用户至今仍不信任订阅界面会自己把问题讲明白(Opus 5 not charging for usage right now?; I burned 9.9B tokens last month and made exactly zero dollars(yet?); Model Overloaded, anyone ?). 这个方向还在浮现,因为问题已经很明显,但很大一部分界面归属仍掌握在现有平台自己手里。


8. 要点总结

  1. 社区已经不再寻找唯一赢家模型,而是开始搭建模型组合。 高信号对比帖不再把 Opus 5、Sol、Fable 和 Codex 当成一场单一排行榜竞赛,而是把它们当成分别适合规划、审阅或执行的角色型工具。(so which is it, For those of you on the fence: Opus 5 after using 5.6 Sol since release)
  2. AI 基本拿下了“第一答案”位置,但还没拿下“证明”位置。 用户觉得 AI 比 Stack Overflow 更快、也没那么敌意十足,但面试、QA 和招聘帖子都在说,真正解释、测试和为结果负责的仍然得是人。(Vibecoders: is StackOverflow dead?, People who landed software engineering jobs while vibe coding, how did you prepare for interviews and prove your actual coding skills?, AI writes faster than we can QA or ship, Why I think vibe code jobs aren't a thing)
  3. 围绕智能体的控制层,正在变成一个独立产品类别。 钩子、明确的委派规则、对抗式审阅,以及上下文卫生得到的关注,都超过了单纯“怎么写提示词”,因为用户现在希望智能体失败能在运行时被真正治理。(Claude Code injects your email address directly into system prompt, Claude Code has a hardcoded instruction telling Opus 5 not to use subagents, In the spirit of trying to add more value to this sub. Let’s talk about hooks., You're shipping bugs if you're not using adversarial reviews with claude code)
  4. 订阅信任如今既取决于原始能力,也取决于计量界面是否透明。 用户在公开分享积分截图、按 token 折算的账单,以及事故链接,因为他们不相信现有界面能把限额、账单或故障解释清楚。(Opus 5 not charging for usage right now?, I burned 9.9B tokens last month and made exactly zero dollars(yet?), Model Overloaded, anyone ?)
  5. 最容易公开证明进展的,依然是在浏览器里能玩或能探索的东西。 Nelly Jellies、Fortune & Flak、Boomstick City 和 Neon Rain 对比赛世界,都给社区留下了可以直接检查的具体产物;但那些成本帖子也说明,发出软件仍然比找到商业牵引力更容易。(I vibe coded a cozy jelly merge game with React, Matter.js and Capacitor. Free, no login, play within 5 seconds., Vibecoded an arcade SHUMP - Fortune and Flak, I made a multiplayer CCG 100% vibe coded!, Opus 5 One-shotted Tokyo Neon City in Three.js, I burned 9.9B tokens last month and made exactly zero dollars(yet?))