跳转至

HackerNews AI - 2026-04-13

1. 大家在讨论什么

1.1 Claude 宕机与 Token 膨胀 🡕

Claude 的可靠性问题连续第二周主导讨论。当天评论最多的帖子(126 条评论)讲的是又一次登录故障;与此同时,一项关于不可见 Token 膨胀的调查进一步加剧了用户的不满。

rob 发布了这起发生在美国太平洋时区工作时间的 Claude.ai 宕机事件状态页面确认,Claude.ai、Claude Code、Claude Cowork 和 Claude API 在 UTC 15:31 至 16:19 期间出现登录错误率上升。walthamstow 指出了一种反复出现的模式:“随便挑一个工作日,当美国太平洋时区开始上班、伦敦还没下班时,Claude 都有相当大的概率宕机。”schmookeeg 描述了整个团队因此停摆的情况:“Claude 只要短暂休息一下,工作流就彻底卡住了。”ericol 另发了一篇题为“又是周一,又是 Claude 宕机”的 Tell HN,称自己遇到了 500 错误,而状态页面当时仍显示一切正常。

另一方面,jenic_ 分享了一项针对 Claude Code Token 消耗的调查。HTTP 代理抓包显示,v2.1.100 每次请求会在服务端额外加入约 20,000 个不可见 Token——对于同一个项目和提示词,v2.1.98 的计费量为 49,726 个 Token,而 v2.1.100 达到 69,922 个。giancarlostoro 分享了 Om Patel 最初披露这一发现的推文a_c 开发了 ccaudit 来检查 Token 使用情况,并发现 98% 的上下文来自缓存。社区目前流传的临时解决办法是通过 npx claude-code@2.1.98 降级。

讨论洞察:mbgerring 总结出一条更普遍的教训:“不知道软件行业还要多久,才会重新吸取 2010 年代的教训:把整个业务建立在另一家公司的 API 上,是一个糟糕的商业决策。”marginalia_nu 则质疑这项 Token 调查的方法,指出字节数与 Token 数的相关性很弱,如果请求并不完全相同,这种对比就无法得出确定结论。

1.2 本地 AI 智能体崭露头角 🡕

AMD 开源 GAIA 成为当天得分最高的帖子(155 分),表明大公司正认真投入将 AI 智能体从云端迁移到本地。

galaxyLogic 分享了 GAIA。这是 AMD 推出的开源 Python 和 C++ 框架,用于构建完全在本地硬件上运行的 AI 智能体——不依赖云端,数据也不会离开设备。文档展示了只需两行代码即可实例化智能体的方式,并内置工具调用、文档搜索和操作执行能力。讨论很快转向 AMD 硬件生态的可信度。coppsilgold 认为,AMD 在支持完整产品线方面依然没有赶上 Nvidia 的策略:“到了某个阶段,缺少这种信号本身就是一种信号,说明投资 AMD 计算生态并不可靠。”xrd 怀疑本地 AI 是否真能“靠运行在 ROCm 上的两行 Python 代码解决”。sabedevops 称 AMD“对非企业用户极不友好”,并指出 iGPU 用户必须伪装成 GFX900,再从源码编译。

讨论洞察:madbo1 给出了乐观的相反观点:如果 GAIA 能简化多智能体的本地运行,“这很可能会推动行业从‘AI 即服务’转向‘AI 即个人基础设施’。”AMD 的企业承诺与开发者体验之间的矛盾仍未解决。

1.3 对 AI 普及的质疑与从业者反驳 🡕

多条彼此独立的讨论逐渐汇聚成一种日益壮大的反叙事:经验丰富的开发者开始质疑,AI 编程智能体能否在严肃的工程工作中兑现承诺。

andsoitis 分享了 Steve Yegge 的一条推文,将 Google 内部的 AI 采用曲线与 John Deere 的技术采用情况相比较,声称用户呈 20/60/20 分布——20% 是智能体高级用户,60% 仍在使用 Cursor 式聊天工具,20% 则完全拒绝使用。aleksiy123 质疑这种说法只是“听起来合理、容易理解,却没有任何依据的叙事”。solarkraft 则质疑这种恐慌的根源:“工程成本稍微下降一点,怎么就足以引发这种歇斯底里?”

shenli3514 分享了 Creao 一篇反对简单粗暴推行 AI 优先策略的帖子fxtentacle 给出了最尖锐的反驳:“你之所以能把 AI 写的代码直接推到生产环境,唯一的原因就是根本没人真正依赖你的产品。”distalx 警告说:“不能让 AI 审查 AI 写的代码,然后就把它称作安全关卡。”

jwpapi 发布了一篇措辞直率的 Tell HN,标题是“我每次使用 AI 都会后悔”。作者描述了审查 Opus 4.6 重构结果的经历,称其花费的精力比手动完成还多。其实际建议是:“利用 AI 的最佳方式,不是让它直接待在你的代码库里,而是把它放在浏览器或其他地方,这样你可以把它当作研究工具使用。”

1.4 Codex 与 Claude Code:竞争格局 🡒

shivang2607 发起了一篇比较 Codex 与 Claude Code 的 Ask HN,吸引了 17 条评论,其中不乏从业者的详细体验。d-lo 表示,自己转向 Codex(GPT-5.4 high)后发现代码质量“基本不相上下”,但更喜欢 Codex 应用的用户体验;不过 Claude Code 更擅长任务跟踪。vampiregrey 认为 Claude Code“更像是一个通用智能体运行时”——可以通过 Playwright 运行 cron 式浏览器自动化循环——而 Codex 更专注于代码生成。kypro 证实,“GPT-5.4 Pro 非常出色,至少与 Opus 4.6 相当”,已有部分团队成员转用 Codex。palguna26 指出:“从生成代码的质量来看,CC 更好,但 Codex 似乎对一切都理解得更透彻。”

1.5 LLM 安全基准测试 🡕

mufeedvh 推出了 N-Day-Bench。这是一项每月更新的基准测试,用于检验前沿 LLM 能否在真实代码仓库中发现已知安全漏洞。该基准测试每月从 GitHub 安全公告中提取新案例,将仓库检出到补丁提交之前的版本,并允许模型在沙箱内执行 24 个 Shell 步骤。目前测试的模型包括 GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro、GLM-5.1 和 Kimi K2.5,所有运行轨迹均已公开。

sigmoid10 发现了一个严重的方法问题:在一个案例中,GPT-5.4 因未找到相关文件而被判定为“遗漏”;Opus 4.6 同样没找到该文件,却凭空编造了一份漏洞报告,并被评为“优秀”。这表明评审模型需要评估完整轨迹,而不能只看最终输出。linzhangrun 则从实践角度提出了另一种看法:Gemini 成功利用了生产系统中一个隐藏的 SQL 注入漏洞,并将其能力评为“至少相当于中级网络安全专业人士”。

1.6 MCP 的价值受到实证检验 🡖

jbatmargin 发布了一项严谨的基准测试,检验 MCP 是否真的能提升编程智能体的表现。测试使用 Codex(GPT-5.4,xhigh 推理强度)完成 Terminal-Bench 2.0 的 89 项任务。加入最受欢迎的第三方文档查询 MCP——Context7——后,结果仅相差 1 项任务(64 项通过,对照组为 63 项),完全处于噪声范围内。尽管明确要求使用 Context7,Codex 在 89 个案例中仅调用了 6 次;而这 6 次调用中,没有一次改变相较基线的结果。这是首个量化证据,对“MCP 能为编程智能体带来可衡量价值”这一假设提出了质疑。


2. 大家对什么感到不满

Claude 可靠性已成为工作流依赖问题

这是当天最主要的不满来源,两个讨论串合计产生了 127+ 条评论。Claude 在美国和英国工作时间重叠期间宕机。开发者称整个团队因此停摆——并不是因为故障持续时间很长(49 分钟),而是因为 Claude 已经成为日常工程工作的关键路径。Token 膨胀调查进一步加剧了不满:使用 Max 20x 套餐($200/月)的用户在 90 分钟内便触及限额,如今他们怀疑服务端注入 Token 正在加速配额消耗。用户不得不降级 Claude Code 版本,这本身就说明信任正在流失。严重程度:高。

AI 代码质量导致工作量高于手动完成

jwpapi 描述了让 Opus 4.6 执行一项中等规模重构任务的经历,其中“每一步都包含一些我认为不正确的假设”,最终发现审查 AI 输出比从头手动完成耗时更久(帖子)。具体的不满在于:AI 重构会偏离重点,生成“奇怪而啰嗦”的输出,还会让开发者失去亲自完成工作时本可建立的心智模型。10keane 也表示:“AI 只在诊断和实现方面很强。我的大多数成功案例,都建立在我已经完全知道该如何解决问题的基础上。”严重程度:中。

AMD 的硬件生态存在缺口

GAIA 的发布再次暴露了开发者长期以来对 AMD ROCm 支持的不满。sabedevops 表示,为了支持 iGPU,自己不得不伪装 GFX900 并从源码编译。他称 AMD“对非企业用户极不友好”,而且“扩展产品支持只是为了抢占市场份额”(帖子)。coppsilgold 认为,缺乏广泛的硬件支持“说明投资 AMD 计算生态并不可靠”。严重程度:中。尽管需求旺盛,这一问题仍阻碍着本地 AI 智能体框架的普及。

AI 优先开发存在问责缺口

fxtentacle 认为,只有在无人依赖产品时,AI 代码快速上线生产环境的工作流才行得通;而要对客户负责,就必须采取“更缓慢、更谨慎的方式”(帖子)。distalx 警告说,自动回滚基础设施不过是“一台以光速制造技术债的高度复杂机器”。严重程度:中。


3. 大家希望出现什么

透明、可审计的 Token 计费

不可见 Token 调查表明,Claude Code 用户无法审计服务端向其上下文窗口注入了哪些 Token。a_c 开发的 ccaudit 是一个起点,但开发者需要官方提供透明机制——在 CLI 中逐请求显示系统提示词 Token、注入上下文和用户内容的明细。目前尚无方案能彻底解决这一问题。机会:直接。

能在本地硬件上可靠运行的 AI 智能体

GAIA 获得 155 分和 34 条评论,说明市场对本地 AI 智能体需求强劲,但 AMD 的两行代码 SDK 演示与现实之间仍有巨大差距。开发者希望本地运行的智能体也能拥有与云端智能体相同的质量和开发体验,而不必研究 ROCm 兼容性矩阵或伪造硬件 ID。机会:竞争型。

智能体代码验证层

Aamir21 开发了 OQP,以标准化根据业务需求验证 AI 生成代码的流程;mufeedvh 则开发了 N-Day-Bench,用于衡量 LLM 发现漏洞的能力。两者都指向同一个尚未满足的需求:以可靠、自动化的方式验证智能体交付的成果是否正确且安全。现有 CI/CD 流水线并不是为无人亲手编写的代码而设计的。机会:直接。

不会过时的智能体上下文

jdjdjdi 开发了 Context Surgeon,让智能体可以从自己的上下文窗口中移除、替换和恢复陈旧内容。eitanlebras 随即提出,希望它能跨会话持久化。更广泛的需求是:上下文管理应当自动化、可持久化,并且足够智能,能够判断哪些内容已经过时,而不是只能被动清理。机会:直接。


4. 正在使用的工具和方法

工具 类别 评价 优势 局限
Claude Code 编程智能体 (+/-) 深度智能体推理、通用运行时、钩子/技能系统 频繁宕机、不可见 Token 膨胀、Max 套餐限额消耗过快
Codex (GPT-5.4) 编程智能体 (+) 代码质量不相上下、理解能力更强、应用体验更受青睐 代码有时较草率,作为通用智能体运行时尚不够成熟
Cursor IDE / 聊天工具 (+) 紧密的编辑循环、集成 VS Code 据 Yegge 所说,主要由采用曲线中间的 60% 用户使用
ROCm GPU 计算 (-) 随着近期工程师加入,情况正在改善 对非企业用户支持糟糕、iGPU 需要变通方案、硬件覆盖面狭窄
MCP (Context7) 智能体协议 (-) 标准化协议、文档查询 严谨测试中未显示可衡量收益;智能体会忽略它
Playwright 测试 (+/-) 成熟的浏览器自动化工具 Claude Code 用它执行 cron 自动化;整体稳定性仍令人担忧
FTS5 搜索 / 检索 (+) 快速、嵌入式全文搜索 mcptube-vision 用它替代向量搜索
Composio 集成层 (+) 为智能体提供 800+ 种工具集成 依赖平台

Claude Code 与 Codex 的竞争正在走向势均力敌。从业者认为二者代码质量接近,但各有所长:Claude Code 更擅长充当通用智能体运行时,包括浏览器自动化、cron 循环和技能系统;Codex 则在理解能力和应用体验方面占优。用户迁移主要是因为 Claude 的速率限制和宕机迫使他们尝试替代方案,而不是因为 Codex 明显更强。


5. 大家在构建什么

项目 开发者 功能 阶段 链接
GAIA AMD 基于 Python/C++ 的本地 AI 智能体框架 Alpha 文档帖子
N-Day-Bench mufeedvh 每月更新的 LLM 漏洞发现基准测试 已发布 网站帖子
Context Surgeon jdjdjdi 让智能体移除、替换和恢复上下文块的代理 Alpha GitHub帖子
Mercury ns90001 用于编排人类与智能体团队的无代码画布 Alpha 网站帖子
OQP Aamir21 面向 AI 智能体输出的开放验证协议 RFC GitHub帖子
Dbg redknight666 支持 15+ 种语言、适配智能体的统一 CLI 调试器 Alpha 网站帖子
Equirect greggman65 隐私优先、完全由 Claude 构建的 Rust VR 视频播放器 已发布 GitHub帖子
mcptube-vision 0xchamin 遵循 Karpathy LLM Wiki 模式的 YouTube 知识引擎 Beta GitHub帖子
Remy sthielen 将带注释 Markdown 编译为全栈应用的智能体 Alpha 网站帖子
SnapState robohobo 面向智能体工作流的通用检查点/恢复状态方案 Beta 网站帖子
AImeter saileshr7 本地优先的 LLM 成本跟踪 SDK Alpha GitHub帖子
LLM Ops Toolkit amans9712 提供商可用性、成本计算器和路由模拟器 已发布 帖子

当天的项目主要集中在三类基础设施缺口上:(1)智能体可观测性与成本跟踪(AImeter、LLM Ops Toolkit、ccaudit);(2)智能体验证与安全(N-Day-Bench、OQP);(3)上下文与状态管理(Context Surgeon、SnapState)。Equirect 是一个引人注目的案例:一位 60 岁、毫无 Rust 经验的开发者通过约 30 小时与 Claude 交互提示,构建出了可运行的 VR 视频播放器。他指出,Claude“弄清楚了如何把 wgpu 纹理连接到 OpenXR 中正在绘制的表面”,速度比他自己找到可用示例还快。Dbg 则针对运行时盲区问题提供了解法——智能体不用真正的调试器,而是“猜测、打印并浪费 Token”。它通过统一 CLI 支持 15+ 种语言,并采用基于守护进程的 PTY 连接,输出简洁且节省 Token。


6. 新动态与关注焦点

AMD 加入本地 AI 智能体竞赛

AMD 的 GAIA 是首个由主要 GPU 厂商推出、专门用于构建在本地硬件上运行的 AI 智能体的开源框架。该框架提供 Python 和 C++ SDK,无需依赖云端即可处理智能体推理、工具调用、文档搜索和操作执行。尽管它在 HN 上获得 155 分,显示出强烈关注,讨论也暴露了开发者对 AMD ROCm 生态成熟度的深度怀疑。其战略意义十分明确:AMD 正试图以本地智能体运行作为切入点,对抗 Nvidia 以云端为中心的 CUDA 生态。开发体验能否匹配这份雄心,仍是悬而未决的问题。(帖子

N-Day-Bench:每月更新的漏洞发现基准测试

N-Day-Bench 推出了一项自适应基准测试,每月从 GitHub 安全公告中提取新案例,以真实 N-day 漏洞测试前沿 LLM。测试集始终领先于模型的知识截止日期,从而避免训练数据污染。目前已有五款前沿模型接受评估,所有运行轨迹均可公开浏览。社区反馈发现了一项关键的评审缺陷:评估模型只对最终报告打分,却未验证发现过程,导致凭空编造的报告也能通过。这表明,在结果值得信赖之前,测试方法仍需收紧。(帖子

首次严谨测试显示 MCP 未带来可衡量收益

Margin Lab 的基准测试使用 Codex 和最受欢迎的第三方 MCP——Context7——完成 89 项真实软件工程任务。结果非常明确:加入 Context7 后,没有任何一项任务的结果发生变化。更值得注意的是,尽管有明确指示,Codex 在 89 个案例中只调用了 6 次 Context7。这表明,在文档 MCP 理应发挥作用的任务中,前沿模型可能已经具备足够的内置知识。这只是一个数据点(一个智能体、一个 MCP、一套基准),但却是首次通过受控实验质疑 MCP 的价值主张。(帖子

Sam Altman 遭遇第二起袭击

Sam Altman 位于旧金山的住所三天内遭遇第二起袭击——继周五的燃烧瓶事件后,又发生了枪击。两名嫌疑人被捕,并被控过失开枪;警方缴获了三支枪。针对 AI 行业领军人物的实体威胁不断升级,折射出公众对 AI 发展态度中令人不安的一面。(帖子


7. 机会在哪里

[+++] 智能体 Token 可观测性与成本控制——不可见 Token 调查(两篇帖子分别获得 53 分和 7 分)、AImeter 和 LLM Ops Toolkit 都指向同一个缺口:开发者看不到 AI 智能体究竟消耗了多少资源、产生了多少成本。AImeter 的基准测试显示,在相同任务上,GPT-4o 的成本是 GPT-4o-mini 的 16 倍。ccaudit 已经出现,但它由社区开发。官方 Token 审计、逐任务成本归因以及提供商集中度风险仪表板仍供给不足。紧迫性高:开发者每月支付 $200,却在 90 分钟内触及限额。

[+++] 本地 AI 智能体基础设施——GAIA 获得 155 分,为当天最高,说明无需依赖云端的智能体需求强烈。目前的主要障碍是 ROCm 生态成熟度,以及两行代码的 SDK 演示与消费级硬件上生产级多智能体运行之间的差距。谁能解决本地模型之上的开发体验层——不只是用 Ollama 做推理,而是提供完整的智能体编排——谁就能拿下 madbo1 所说的“AI 即个人基础设施”市场。

[++] 智能体代码验证标准——OQP 和 N-Day-Bench 分别从不同角度处理同一个问题:验证 AI 生成的代码是否正确、安全。OQP 提出一种类似 OpenAPI 的智能体验证标准;N-Day-Bench 则提供基准测试。两者都尚未成熟,但多个讨论串已经印证了这一痛点。机会在于构建 CI/CD 集成,让验证自动进行,而不是停留在协议层。

[++] 智能体上下文与状态管理——Context Surgeon(上下文清理代理)、SnapState(跨框架检查点/恢复)以及 Token 膨胀讨论都指向同一个缺口:智能体在长会话中会丧失上下文质量,而目前没有统一标准来跨会话、跨框架持久化、管理或迁移智能体状态。社区对 Context Surgeon 的反馈很快就提出了持久化和摘要替换需求,证实市场需要更全面的解决方案。

[+] AI 智能体的运行时调试——Dbg 针对一个具体盲区:智能体会猜测运行时状态,而不是直接观察。通过基于守护进程的架构和统一 CLI 支持 15+ 种语言,在技术上颇具雄心。随着智能体从代码生成走向调试和维护,运行时可观测性将变得不可或缺。能与 Claude Code 和 Codex 无缝集成的工具将拥有先发优势。


8. 要点总结

  1. Claude 宕机已不再是偶发事件,而是一种规律。 周一反复宕机,再加上不可见 Token 膨胀的发现,正推动用户把 Codex 当作风险对冲方案,而不是彻底替代品。信任流失会不断累积。(帖子

  2. AMD 的 GAIA 表明,本地 AI 智能体正在成为企业战略重点。 当天得分最高的项目(155 分)并非创业公司演示,而是 GPU 厂商推出的开源框架。其战略含义是:云端与本地智能体运行之争正在演变成平台战争,而不再只是开发者偏好问题。(帖子

  3. 首个严谨的 MCP 基准测试未发现任何可衡量收益。 最受欢迎的文档 MCP Context7 在 89 项真实工程任务中没有改变任何结果。即使收到明确指示,智能体仍有 93% 的时间没有使用它。这对 MCP 生态的一项核心假设提出了挑战。(帖子

  4. 对 AI 普及的质疑正从零散轶事汇聚成系统化框架。 Yegge 的 20/60/20 采用曲线、Creao 对 AI 优先策略的批评,以及从业者个人的后悔帖,正在形成一套结构化的反叙事。处于中间的 60%——把 AI 当聊天工具而不是智能体——可能才是大多数开发者的稳定状态。(帖子

  5. LLM 漏洞发现基准测试需要改进方法,才能获得信任。 N-Day-Bench 的思路很有前景,但其评审缺陷——将凭空编造的报告判为正确——削弱了当前排行榜结果的可信度。按月更新的机制合理,但评估流程需要人工验证。(帖子

  6. 智能体成本透明度将成为下一个竞争焦点。 开发者无法审计服务端注入了哪些 Token,无法预测何时会触及限额,也没有标准方式把成本归因到具体智能体任务。AImeter 发现,在相同任务上,不同模型的成本差异可达 16 倍,这表明整个行业可能存在巨大的浪费。(帖子

  7. Codex 与 Claude Code 正在功能上趋同、理念上分化。 Claude Code 正成为通用智能体运行时,涵盖 cron 循环、浏览器自动化和技能系统;Codex 则凭借理解能力和应用体验占优。这种竞争对用户有利,但随着工作流不断深化,工具切换成本也会随之增加。(帖子