跳转至

Twitter AI 智能体 - 2026-07-27

1. 人们在讨论什么

1.1 上下文工程正在变成运行时架构 (🡕)

这一天最反复出现的观点是:智能体质量如今取决于上下文如何被持续组装、裁剪和路由,而不是把提示词越写越长。至少有 6 条高信号帖子都指向同一转变:删掉冗余提示词,只在需要时加载参考资料,把持久行为移进技能和记忆层,并把生成和评估拆开。

@harleyfoote_ 认为(137 次点赞、7 条回复、231,629 次浏览)Anthropic 的工程师据称为 Opus 5 / Fable 5 删掉了超过 80% 的 Claude Code 系统提示词,却没有可测的编程评测下滑;他随后在回复里把更深一层的意思说得更明白:提示词只是更大运行环境中的一小部分,而这个环境由 Skills、CLAUDE.md、记忆以及其他运行时状态共同拼装而成。@aiedge_ 列出(7 次点赞、3 条回复、2,212 次浏览、24 次收藏)了一份类似的 Claude 5 清单:用判断替代僵硬规则,设计更干净的工具接口而不是往里塞示例,并按需渐进加载上下文,而不是维护一个臃肿的项目文件。

@alex_verem 写道(19 次点赞、6 条回复、3,515 次浏览、28 次收藏),提示词、上下文、测试框架和循环各自在不同层级上失效,真正危险的是循环状态如果存活得够久,就会变成“承重结构”,因此独立、持怀疑态度的评估器比更聪明的生成器更重要。@0xRafy 提出(22 次点赞、9 条回复、2,218 次浏览、26 次收藏),图谱工程是继提示词、上下文、测试框架和循环之后缺失的第五层,并认为图谱解决的是跨智能体状态与来源追踪,而不只是检索。

展示图谱工程作为共享记忆、跨智能体状态与来源校验的知识图谱手册页面

@AiandTechHub 指出(46 次点赞、11 条回复、615 次浏览),IBM 的结构化知识图谱课程说明,这个主题正在变得可教学,而不只是个梗。@kv1nsiii 警告说(24 次点赞、9 条回复、1,287 次浏览、22 次收藏),6 个爆火的“42 个 Claude 技能”链接指错了仓库,另外 4 个又把人直接扔到根目录,而被引用的 ToxicSkills 研究则把讨论从“多装一些技能”推向“先把 SKILL.md 读完”。

讨论要点:回复区更关心的不是给下一层起什么名字,而是怎么把它做轻。删除、延迟加载和独立评估器反复充当成熟度信号,而不安全或低质量的技能包则成了围绕模型的真实供应链问题。

与前日对比:7 月 21 日的重点还在通过导师卡片、课程和论文解释图谱工程。7 月 27 日则把这个想法往操作实践推近了一步:去掉提示词冗余,把行为拆进工具和技能里,并把图谱与评估器当作生产环境的控制面。

1.2 基准测试更具领域针对性,也更偏向长时程 (🡕)

第二个讨论簇围绕测量展开。人们分享的已不再是通用排行榜,而是专门给代码库维护、漏洞复现、罕见病诊断和智能体式 RL 基础设施加压的基准测试,这让评估讨论越来越聚焦端到端系统,而不是裸模型。

@dexhorthy 分享了(226 次点赞、16 条回复、41,709 次浏览、437 次收藏)一篇关于 Opus 5 的第三篇 SlopCodeBench 总结,而最尖锐的回复来自 @rohangupta_:他说团队已经把一套“对抗性背压测试框架”用在同一个基准上;这说明长时程编程评测已经在改变测试框架的设计,而不只是给模型排座次。@testingcatalog 提到(47 次点赞、2 条回复、5,461 次浏览)Microsoft 96% 的 CyberGym 成绩,而 @rohanpaul_ai 拆解了(12 次点赞、2 条回复、2,604 次浏览)MDASH 的优势:它在 MAI-Cyber-1-Flash 外围搭了一层由 100 多个智能体组成的编排层,里面有专门角色、工具、提示词和停止规则。

显示搭载 MAI-Cyber-1-Flash 的 MDASH 领先 GPT-5.5 Cyber、Gemini 3.5、GPT-5.6 Sol 和 Mythos 5 的 CyberGym 柱状图

@danielmckinn0n 介绍了(3 次点赞、1 条回复、630 次浏览)RareBench 0.1:这是一个包含 122 个病例的罕见病基准,用来支撑 Gamow 的“George”诊断智能体;比起讨论串里的说法,更重要的是附带图表本身:Opus 5 的诊断率领先,Kimi K3 在预计成本明显更低的前提下也出人意料地接近;错误矩阵则暗示,集成方案可能胜过任何单一模型。@xdotli 提到(15 次点赞、1 条回复、1,139 次浏览、7 次收藏)Kimi 的 AgentENV 发布;AgentENV 项目 和它的 发布文章 都把它描述为一个基于 Firecracker 的运行时,面向大规模智能体式 RL,支持快照 / 分叉工作流,并能大幅降低环境成本。

比较前沿模型在罕见病诊断率与单次运行成本上的 RareBench 图表

讨论要点:有两类细节反复出现。第一,测试框架设计、专用路由和环境控制,越来越成为基准获胜的关键,而不只是基础模型质量。第二,Kimi / Gamow 帖子也让信息流开始思考每单位结果成本和误差多样性,而不只是头部准确率。

与前日对比:7 月更早些时候的讨论仍主要围绕循环和图谱的教学展开。到了 7 月 27 日,这场对话明显更偏实证:同一天里出现的基准材料横跨编程、网络安全、医疗和 RL 基础设施。

1.3 安全讨论从“多加小心”转向授权、证明与联盟 (🡕)

最强的信任主题是,智能体安全正在围绕权限边界和公开证据被重新定义,而不是停留在泛泛而谈的红队口号上。至少有 5 条分量很重的内容指向同一种设计直觉:是谁发起的、允许什么任务、什么动作算正当,以及系统最终能回传什么证明。

@NVIDIAAI 宣布(752 次点赞、52 条回复、35,377 次浏览),向 Open Secure AI Alliance 贡献 NOOA 等资产,把 NOOA 放在一个开源智能体测试框架研究项目的中心位置,也把智能体安全从单一厂商的定位动作,变成了一个由 37 个成员组成的联盟叙事。@fly51fly 贴出(2 次点赞、101 次浏览)论文《Agent Security Needs Redefinition through a Holistic Framework》;论文附图显示,同样的动作文本,会因为来源授权、任务对齐、动作对齐和数据隔离不同,而变成安全或恶意的行为。@posthog 认为(24 次点赞、2,677 次浏览、31 次收藏),如果只因为智能体更聪明就放弃额外控制,就像因为车变好了就不系安全带一样;这个比喻和当天更正式的研究语言正好互相呼应。

展示同一条命令会因下达者和授权任务不同而被允许或拦截的上下文安全示意图

@Acurast 演示了(60 次点赞、29 条回复、10,641 次浏览)OKX AI Marketplace 上的 Confidential TEE 智能体:它能在去中心化智能手机网络的可信执行环境里运行 shell 或 Python,回复区则着重强调带签名的执行证明和 x402 支付。@yashaswini_s_s 分享了(9 次点赞、3 条回复、407 次浏览)一个帮祖母在 WhatsApp 上订购杂货的智能体,而最尖锐的回复立刻补上了缺失的控制模型:预先批准的购物篮和硬性价格上限,这样即便声音被克隆或失真,也无法凭空创造新的可支付意图。

讨论要点:最实用的安全建议不是“禁止自治”。而是缩小权限、证明执行过程,并把“允许的意图”和“看起来合理的文本”分开。这个方向同时吻合论文里的框架,以及更产品化的 TEE / 支付案例。

与前日对比:7 月 21 日还在关注钱包里的受限自治和包安全。7 月 27 日则把范围扩大到联盟发布、明确的上下文安全框架,以及一个让授权问题一眼可见的消费者支付案例。

1.4 智能体工作区开始变成完整的操作环境 (🡕)

第四个主题是,“使用智能体”越来越意味着围绕它们搭起一套持久化工作界面:云沙箱、浏览器工作区、终端、语音层、记忆后端和审查循环。最强的帖子讨论的已不再是选哪个模型,而是智能体驻留在哪一层、周围还有哪些配套。

@vinvan 写道(65 次点赞、10 条回复、16,880 次浏览、132 次收藏),企业还没准备好迎接云端智能体的迁移,并在回复里把运营栈说得更具体:Open-Inspect/Devin/Cursor 负责执行层,Infisical 管密钥,AgentMail 管邮件,Limrun 用来做 iOS 模拟。@chakhan22 记录了(1 次点赞、2 条回复、133 次浏览)一套真实的每周工作流,由 Claude Code、Codex、Hermes Agent、WezTerm、Herdr 和一条运行后 “No Mistakes” 审查流水线组成,同时也报告了把 GPT-5.6 放在 Claude Code 这个运行框架后面时,反复撞上上下文上限。@pavlenex 展示了(228 次点赞、9 条回复、9,530 次浏览、372 次收藏)Buzz:这是一个面向视频采集、报告撰写、bug 分流和定时工作流的协作编排界面,但回复区立刻抱怨起耗电、token 统计和会话上限。

@witcheer 解释了(34 次点赞、6 条回复、865 次浏览、16 次收藏)Hermes Agent 里具体的记忆与技能控制:定时提醒、回复后的复审、可选的写入审批、详细通知,以及过时技能清理器。@mhdfaran 强调了(17 次点赞、9 条回复、4,164 次浏览)Voicebox 是一个面向 MCP 兼容智能体的本地优先语音层,支持语音克隆、听写和端侧处理;与此同时,@Daniel_Farinax 介绍了(30 次点赞、6 条回复、3,127 次浏览、12 次收藏)GrokTerm:这是一个带语音能力和共享控制平面的多标签 PTY 宿主。@ag2oss 发布了(9 次点赞、2 条回复、364 次浏览、5 次收藏)AG2 v1.0.0,将其定位为一个面向长时间运行、多智能体工作的协议驱动 AgentOS。

展示记忆提醒、回复后审查、审批开关、通知和技能整理功能的 Hermes Agent 控制图

讨论要点:共同模式不是“一个超级智能体”,而是分层界面:一个工具管密钥,另一个管浏览器状态,另一个管语音,另一个负责运行后审查,另一个负责记忆和技能。哪怕最乐观的操作者帖子,也仍然写满了上限、成本、审批和状态管理这些保留条件。

与前日对比:7 月 21 日是把智能体推入文档、幻灯片和收件箱等办公产物。7 月 27 日则继续扩大这个表面积,但重点转向智能体自身周围的控制平面:云端就绪性、终端宿主、语音 I/O、长生命周期记忆循环,以及显式的审查界面。


2. 令人困扰的问题

缺乏来源追踪的技能泛滥

想把技能真正用起来的人,仍然会被失效的发现路径和薄弱的信任边界绊倒。@kv1nsiii 警告说(24 次点赞、9 条回复、1,287 次浏览、22 次收藏),6 个爆火的“42 个 Claude 技能”链接指错了仓库,另外 4 个又把人直接带到根目录,而被引用的 ToxicSkills 研究发现,在被测试的技能里,有相当比例存在严重缺陷。抱怨的不只是链接腐坏,而是安装一个技能往往就意味着要用智能体权限执行陌生人的代码。@vinvan 写道(65 次点赞、10 条回复、16,880 次浏览、132 次收藏),云端智能体栈如今需要显式的密钥管理和沙箱工具,而 Open-Inspect README 明确写道,它的共享 GitHub App 设计只对单租户部署安全。严重性:高。人们的应对方式是先读 SKILL.md 文件、少装一些技能包,并缩小仓库或密钥的作用范围。这值得投入构建,因为无论是第一次接触技能的用户,还是高级云端智能体操作者,都还在手工做同样的信任判断。

会自我打分、还会掩盖坏状态的循环

可靠性方面最核心的挫败感,仍然是看不见的漂移。@alex_verem 写道(19 次点赞、6 条回复、3,515 次浏览、28 次收藏),一个坏循环会把一个错误假设在多轮里变成“承重”状态,这也是为什么独立的怀疑者比更讨喜的生成器更重要。@fly51fly 贴出(2 次点赞、101 次浏览)一篇论文,指出同一个表层动作既可能无害,也可能恶意,取决于来源授权、任务对齐、动作对齐和数据隔离,所以只看内容的检查会漏掉真正的违规点。@witcheer 解释了(34 次点赞、6 条回复、865 次浏览、16 次收藏),Hermes 现在需要显式的记忆和技能审批开关,再加上一个策展流程,才能让自我改进过程保持可理解。严重性:高。开发者的应对方式是引入外部评估器、审批闸门,以及更可见的记忆写入。这值得投入构建,因为这种失败模式隐蔽、代价高,而且在编程、安全和记忆系统里被反复重新发现。

云端智能体让密钥和执行状态变成运维问题

向后台和云端智能体迁移,正在暴露出一类新的运维痛点。@vinvan 认为(65 次点赞、10 条回复、16,880 次浏览、132 次收藏),很多公司还没准备好云端智能体;其中一条回复说,智能体永远拿不到直接的 AWS 访问权限,因为密钥被放在 moto 后面,数据库状态则通过快照恢复。Infisical 的 Cursor 云端智能体指南 也明确提出了同样的抱怨:静态密钥界面解决不了轮换、审计轨迹或快照泄漏,所以密钥必须在运行时拉取,而不是预先烘焙进环境。严重性:高。人们的应对方式是使用机器身份、运行时注入密钥、收窄仓库作用域,以及隔离沙箱。这值得投入构建,因为痛点恰好出现在采用趋势下一步要去的地方:能够长期运行、并拥有真实基础设施访问权的智能体。

真实操作者栈依然昂贵、耗电,而且受上下文限制

即便是最热情的工作流帖子,也带着日常摩擦。在 @pavlenexBuzz 演示(228 次点赞、9 条回复、9,530 次浏览、372 次收藏)的回复里,有用户抱怨这个应用太耗电、看不到 token 用量,而且很快就会撞上会话上限。@chakhan22 记录了(1 次点赞、2 条回复、133 次浏览),在 Claude Code 后面测试 GPT-5.6 时反复遇到上下文上限问题——哪怕这已经是一套精心拼装、包含 Hermes、WezTerm 和运行后复审的工作流。严重性:中。人们靠 Voicebox 这样的本地优先层、GrokTerm 这样的多标签宿主,以及运行后审查循环来缓解,但底层问题并没有解决。这值得投入构建,因为操作者疲劳就出现在那些原本最看好智能体采用的讨论串里。


3. 人们期望的功能

具备授权感知能力的控制平面

最明确的现实诉求不是“让智能体更聪明”,而是“让它们知道谁有权要求什么”。@fly51fly 贴出(2 次点赞、101 次浏览)一套框架,认为同样的动作文本,会因为来源授权、任务对齐、动作对齐和数据隔离不同,而变成安全或恶意的行为。@posthog 认为(24 次点赞、2,677 次浏览、31 次收藏),更聪明的模型并不能取消外部约束的需要,而 @yashaswini_s_sWhatsApp 杂货智能体(9 次点赞、3 条回复、407 次浏览)的最高赞回复,则立刻要求预先批准的购物篮和硬性价格上限。@Acurast 展示了(60 次点赞、29 条回复、10,641 次浏览)执行侧的一部分答案:由 TEE 支撑的证明机制,但完整的用户意图层仍未被覆盖。这是一个紧迫的现实需求,而今天的答案仍然只有一部分。机会:直接切入。

面向普通团队的云端智能体就绪工具包

人们想要一套可部署的配方,用来搭建长时间运行的云端智能体,覆盖密钥、快照、仓库访问和沙箱选择,而不用每个团队都从零发明一遍。@vinvan 写道(65 次点赞、10 条回复、16,880 次浏览、132 次收藏),很多公司还没准备好云端智能体;他随后又在回复里把栈的组成逐项列出来:Open-Inspect、密钥工具、邮件界面和模拟器支持。Infisical 的 Cursor 云端智能体指南 覆盖了运行时注入密钥,Open-Inspect README 也记录了一种很强但明确只支持单租户的设计;这个需求只被满足了一部分,运维负担却依然很重。这是一个带有直接预算和安全后果的现实需求。机会:直接切入。

能跨会话延续、并改变下一次决策的记忆

信息流不断把记忆说成让智能体真正有用的关键,但更尖锐的诉求关心的是行动,而不是回忆。@Mnilax 认为(12 次点赞、3 条回复、182 次浏览、12 次收藏),当前的记忆基准测试问的是智能体能不能回想起看过什么,而不是在行动和反馈之后,记忆会不会改变它下一次的决策。@witcheer 展示了(34 次点赞、6 条回复、865 次浏览、16 次收藏)Hermes 现在如何围绕记忆写入加上显式审批、通知和策展,而 @chakhan22 则把(1 次点赞、2 条回复、133 次浏览)Hermes 当成更大工作流栈里的一个实用“第二大脑”。@0xRafy 把它定位为(22 次点赞、9 条回复、2,218 次浏览、26 次收藏)图谱工程的一个答案,但整体需求仍未被解决。这是一个现实需求,已经有几个只解决局部问题的竞争者。机会:竞争性切入。

用可策展、可审计的技能路径取代病毒式技能大礼包

人们想要更小、更好、更安全的技能包和学习路径。@kv1nsiii 展示了(24 次点赞、9 条回复、1,287 次浏览、22 次收藏)原因:损坏的仓库、重复的列表,以及未经审查的陌生人代码,会把入门体验毁得很糟。与此同时,@AiandTechHub 指向(46 次点赞、11 条回复、615 次浏览)IBM 的结构化知识图谱专项课程——这正是人们真正信任的那类课程体系,而 @rlaope 则把(18 次点赞、1 条回复、1,676 次浏览、26 次收藏)Oh My Hermes 打包成一层策展过的操作层,而不是另一份松散列表。这是一个已有早期产品化答案的现实需求,但还没有清晰默认选项。机会:竞争性切入。


4. 使用中的工具与方法

工具 类别 评价 优势 局限
Claude Code + Codex 编程智能体组合 (+/-) 适合真实操作者工作流的日常主力组合;围绕技能、记忆和审查循环的生态很强 受上下文上限、成本 / 配额限制影响,而且仍需要外部验证
Kimi K3 开放权重模型 (+/-) 在编程 / 智能体场景上很强,且在基准图表中具备有竞争力的结果成本 基础设施负担重;收益依赖强大的外围运行时和测试框架
MDASH + MAI-Cyber-1-Flash 网络安全测试框架 (+) CyberGym 成绩达 96%,并具备专用路由,成本也低于 Microsoft 之前的栈 强领域专用、偏预览版风格,而且依赖庞大的遥测与编排层
Hermes Agent 智能体壳层 / 记忆层 (+/-) “第二大脑”工作流、自动记忆、技能创建,以及显式审批控制 需要策展、调校审批策略,并持续清理,才能保持可理解
Buzz 协作 / 编排 (+/-) 用于报告、bug 分流、排期和智能体协作的共享工作区 耗电、token 统计薄弱,还常被抱怨有会话上限
Open-Inspect 后台编程智能体 (+/-) 支持 Slack / GitHub / Linear / webhook 触发、定时运行、浏览器自动化和并行沙箱 单租户安全模型,以及对共享 GitHub App 的假设
Infisical 密钥管理 (+) 支持运行时注入密钥、轮换、审计轨迹,并能更紧地控制云端智能体的影响面 增加身份与初始化开销,也多了一层运维表面
Voicebox 语音 I/O / MCP 层 (+) 本地优先的语音克隆、听写、隐私保护,以及给支持 MCP 的智能体提供的一次调用语音能力 本地部署以及硬件 / 运行时开销仍由用户承担
AG2 v1.0 智能体框架 / AgentOS (+) 协议驱动的多智能体网络、事件流、MCP/A2A 和评估钩子 并不是经典 AutoGen 式流程的即插即用升级
AgentENV 沙箱运行时 / 智能体 RL 基础设施 (+) Firecracker 隔离、快速 snapshot/fork,以及大规模智能体执行的成本优势 基础设施负担重、以 Linux/KVM 为先,而且如果没有额外授权控制,直接暴露并不安全
GrokTerm 终端宿主 (+) 多标签 PTY、共享控制平面,以及贯穿真实 shell 会话的双向语音 仍属 WIP、以 macOS 为先,而且提到 Linux 构建尚未充分测试

在表格之外,整体满意度大致落在“有前景但需要脚手架”和“只有把缺失的控制层补上才有用”之间。@chakhan22 (1 次点赞、2 条回复、133 次浏览)Claude Code、Codex、Hermes Agent 和一条运行后审查流水线搭了一套方案,因为没有任何单一界面能同时覆盖记忆、执行和验证。@pavlenex 展示了(228 次点赞、9 条回复、9,530 次浏览、372 次收藏)协作编排的上行空间,但回复区仍在抱怨耗电、会话上限和 token 用量不透明。

最常见的权宜方案都在设边界:用运行时拉取密钥取代存储式密钥、用单租户部署取代共享信任、用显式记忆审批取代静默写入、用独立审查循环取代自我打分。@vinvan 把它视为(65 次点赞、10 条回复、16,880 次浏览、132 次收藏)一个横跨沙箱、密钥、邮件和设备模拟器的栈问题,而 @witcheer 则把(34 次点赞、6 条回复、865 次浏览、16 次收藏)Hermes 记忆变成了一个受到显式治理的子系统。

迁移模式正在从单体提示词转向分层专精。模型选择依然重要,但当天最强的材料都在说,真正持久的优势来自上下文组装、路由、可观测性、记忆和证明。因此,竞争格局不再像“一个智能体赢者通吃”,而更像栈的拆分。Kimi K3 这类前沿模型拼成本 / 性能,MDASH 这类系统拼领域测试框架质量,Hermes 这类壳层和 GrokTerm 这类终端宿主拼操作者体验,AG2 这类框架或 AgentENV 这类运行时则拼模型周围的基础设施层。


5. 人们在构建什么

项目 构建者 功能 解决的问题 技术栈 阶段 链接
Buzz @pavlenex 面向报告、bug 分流、视频采集、触发器和排期的协作智能体工作区 把孤立的一人智能体会话变成团队共享工作流 共享频道、触发器、排期、智能体动作;更深层技术栈未公开披露 Beta 帖子
Acurast Confidential TEE agent @Acurast 在去中心化智能手机网络的可信执行环境里执行 Shell 或 Python 为智能体提供带签名证明和支付轨道的机密计算 TEE 支撑的智能手机、Shell/Python、x402 支付、IPFS、OKX AI Marketplace Beta 帖子
Oh My Hermes @rlaope 打包记忆、编程编排、wiki 构建和面向特定领域的 Hermes 工作流 用一层策展过的 Hermes Agent 操作层取代插件蔓延 Hermes Agent、36 个技能、7 个角色智能体、Kanban、交付证据工作流 Beta 帖子
GrokTerm @Daniel_Farinax 在真实的多标签终端里运行语音驱动的智能体会话 给智能体提供原生 PTY 宿主,而不是伪浏览器终端 Rust、PTY 宿主、Grok Voice、多标签会话、macOS app/CLI Alpha 帖子, 网站
Voicebox jamiepine 让 MCP 兼容智能体能说能听的本地优先语音工作室 在不依赖云端语音栈的情况下加入保护隐私的语音克隆、听写和语音输出 MCP server、本地 / 离线处理、7 个 TTS 引擎、23 种语言 Beta 仓库
AgentENV kvcache-ai 面向大规模智能体式 RL 与沙箱执行的 Firecracker 运行时 降低大规模训练和评估智能体时的环境成本 Firecracker microVM、snapshot/fork、快速恢复、Linux/KVM 已发布 仓库, 帖子
AG2 v1.0 ag2ai 面向长时间运行多智能体系统的协议驱动 AgentOS 为构建者提供带事件流和评估钩子的生产导向框架 Python 包、事件流、多智能体网络、MCP/A2A、AG-UI、评估 已发布 仓库, 帖子
Reelful @katedeyneka 面向移动端的智能体式视频编辑器,可按提示词规划、剪辑、验证和渲染 把智能体复杂度藏在原生手机编辑流程后面 移动 app、媒体分析、隔离 VM、自研编辑技能、Remotion、验证器 已发布 帖子
Nextbrowser @nextbrowser_oss 托管式浏览器会话,智能体可复用其中的配置档、脚本和技能 给智能体一个能在网页上持续工作的地方 托管浏览器配置档、实时串流、自定义脚本、可复用技能、桌面应用 Beta 网站, 帖子
George / RareBench @danielmckinn0n 为罕见病诊断工作流做基准测试并构建智能体化流程 试图用基于基准的智能体设计改善新生儿低诊断率 RareBench 评估、表型 + 基因组输入、模型测试框架、集成 / 误差分析 Alpha 帖子

最有辨识度的面向消费者产品是 Reelful。@katedeyneka 展示了(12 次点赞、1 条回复、251 次浏览)一条流程:从用户素材和提示词开始,先请求对方案的显式批准,再把工作交给一个沙箱化智能体,由它编写 Remotion 组合,并在渲染前通过验证层。同样的“把复杂度藏起来,把护栏留住”模式也出现在 Buzz 和 Voicebox 上:产品表层保持简单,而编排或语音基础设施藏在下面。

反复出现得最多的构建模式是“给智能体一个真正工作的地方”。GrokTerm 把终端变成一个支持语音委派的多会话智能体宿主;Nextbrowser 对浏览器配置档和脚本做了同样的事;Oh My Hermes 则把这套逻辑用在记忆、技能和操作流程上。这些是彼此独立的项目,但它们在从不同角度解决同一个问题:聊天界面太薄,所以构建者开始在模型周围加上持久化工作区。

偏基础设施的项目也在向显式边界收敛。AgentENV 优化运行时底座,AG2 为长时间运行系统交付协议与评估层,Acurast 增加了机密执行与证明,而 George / RareBench 则把基准设计当作通往医疗智能体的路径,而不是一个附带产物。这四者的共同模式是:认真的构建者在承诺更多自治之前,先投资于沙箱、评估、证明和可复用控制平面。


6. 新动态与亮点

Open Secure AI Alliance 让智能体安全进入联盟化阶段

@NVIDIAAI 宣布(752 次点赞、52 条回复、35,377 次浏览),正在把 NOOA 和其他开源资产贡献给 Open Secure AI Alliance。这很重要,因为公开叙事已经从某一家公司的安全姿态,转向了一个带有具体测试框架研究和共享工具的共同防御行动。

AgentENV 把智能体运行时层做成了一个产品类别

@xdotli 提到(15 次点赞、1 条回复、1,139 次浏览、7 次收藏)AgentENV:它不再是藏在内部的组件,而是一个刚刚发布的独立框架。配套公开文档描述了 Firecracker 快照、可 fork 的环境,以及大幅降低的开销,这让运行时经济性本身也成了当天新闻的一部分,而不只是模型性能。

AG2 v1.0 把开源框架推向 AgentOS 设计

@ag2oss 发布了(9 次点赞、2 条回复、364 次浏览、5 次收藏)一次从头重写的 AG2,带来事件流、多智能体网络、MCP/A2A 支持、评估钩子,以及置于其上的权限优先助手。重要的不只是版本号往上跳,而是框架作者现在正把长时间运行的编排、可观测性和协议支持打包成一等默认配置。

RareBench 0.1 让医疗智能体评估变得具体

@danielmckinn0n 预告了(3 次点赞、1 条回复、630 次浏览)RareBench 0.1:这是一个面向罕见遗传病诊断、包含 122 个病例的基准,并直接把它和 Gamow 未来的“George”智能体绑在一起。附带图表的信息量异常大:它们比较了诊断率、成本和误差多样性,而这个领域的基线问题本身依然很严重。

Acurast 展示了付费智能体的公开执行证明路径

@Acurast 演示了(60 次点赞、29 条回复、10,641 次浏览)一个 OKX 市场里的智能体:它接收 shell 或 Python 任务,在 TEE 支撑的智能手机网络里运行,并在 x402 支付后返回签名证明。之所以突出,是因为执行、支付和证明闭环全都被放进同一个公开材料里。


7. 机会在哪里

[+++] 云端智能体运行时治理 — 最强、最直接的机会,仍是位于长时间运行智能体与真实基础设施之间的那一层。@vinvan 把它描述为 云端智能体就绪性的一套栈,横跨执行基础设施、密钥、邮件和模拟器,而 Infisical 的云端智能体指南Open-Inspect README@AcurastTEE 演示 都指向同一组缺失能力:作用域受限的凭据、沙箱策略、执行证明,以及可审查的状态。

[+++] 持久化智能体工作区 — 多个彼此独立的构建者都在给智能体一个持久工作的地方,而不是再塞一个悬浮聊天窗口。GrokTerm、Nextbrowser、Voicebox、Hermes Agent 和 Buzz 分别从终端、浏览器、语音、记忆和团队协作这些切入面入手,这让它更像一个强烈的收敛信号,而不是零散的产品口味。

[++] 可信的技能与记忆供应链@kv1nsiii 展示了,技能发现已经是一个信任和安装质量问题,而 Hermes 和 Oh My Hermes 给出了一种应对策略:审批、策展、角色组合包和生命周期管理。这个机会很实在,但竞争也会激烈,因为很多团队都能交付某种“策展技能 + 审查”版本。

[++] 领域化测试框架与基准产品 — SlopCodeBench、MDASH、RareBench 和 George 都在说明,价值正在转向为单一任务调优的基准与编排,而不是通用模型接入。这一点在安全和医疗里尤其强,因为在更狭窄的工作流周围,买方更容易为评估、路由、停止规则和审计轨迹买单。

[+] 面向消费者的安全行动智能体@yashaswini_s_s 展示了 一个可信的日常场景:用语音下杂货单;Reelful 在移动视频编辑上也给出了类似信号。这个信号还在浮现,因为产品需求显而易见,但控制层——支付上限、审批方案、验证和语音安全——还没有标准化。


8. 要点总结

  1. 人们越来越把智能体质量看成运行时架构问题,而不是提示词技巧。 Harley Foote 对 Claude Code 的总结、Alex Verem 对提示词 / 上下文 / 测试框架 / 循环的拆分,以及 0xRafy 的图谱工程层,都把真正持久的工作描述成上下文组装、评估和状态管理,而不是把提示词写得更长。(来源)
  2. 基准测试正在迅速变得按领域、按工作流来定制。 同一天里既有 SlopCodeBench 的讨论,也有 Microsoft 95.95% 的 CyberGym MDASH 成绩,以及面向罕见病诊断的 RareBench 0.1;这是一组异常强的证据,说明智能体构建者如今优化的是具名工作负载,而不是通用排行榜。(来源)
  3. 安全讨论已经从模糊的谨慎提醒,转向权限、证明和范围。 上下文安全框架、PostHog 的“安全带”比喻、Acurast 带证明的 TEE 执行,以及杂货智能体回复里提到的已批准购物篮,都把焦点放在谁能授权一个动作,以及系统如何证明究竟发生了什么。(来源)
  4. 最活跃的构建者正在围绕智能体搭工作区,而不只是做智能体本身。 GrokTerm、Nextbrowser、Voicebox、Hermes 和 Buzz 都在给模型提供更持久的环境——终端标签页、浏览器配置档、语音 I/O、受管理的记忆,或团队协作——这说明界面层已经成了重要的产品表层。(来源)
  5. 云端智能体的采用,先会卡在运维成熟度,而不是原始模型能力。 当天最强的操作者讨论串,是 Vin Van 给云端智能体列出的栈清单;它也和 Infisical、Open-Inspect 关于密钥、快照和租户隔离的外部指引完全对得上。(来源)