跳转至

Twitter AI Agent - 2026-08-29

1. 人们在讨论什么

1.1 AI Agent 工作被重新表述为招聘与培训问题(🡕)

8 月 29 日最明显的变化是,ai-agent 相关讨论不再把“AI engineer”当作一个模糊身份,而是开始明确具体岗位、技能和培训路径。至少有四条强信号支撑这一主题:Dia 的“Model Behavior”招聘帖、广泛传播的 Karpathy 讲座总结、Anthropic 的课程串帖,以及 Andrew Ng 关于软件基础的提醒。相比 8 月 28 日强调软件基础和专业化路径,8 月 29 日则把同样的观点进一步翻译成了劳动力市场语言。

@NickADobos 表示(305 个赞、39 条回复、18,936 次浏览、275 次收藏)称,Dia 正在为“Model Behavior”团队招聘,并指出该团队此前叫 Prompt Engineering 团队,但职责早已扩展到 harness 设计、MCP、记忆、评测、快速原型开发,以及端到端企业功能交付。这条帖子之所以重要,是因为它揭示了一家真实公司内部已经发生的命名变化:这份工作不再被描述为写巧妙的提示词,而是要负责在工具、记忆和约束包围模型之后,模型行为会如何变化。回复区又补充了进一步信号:有批评者指出,这个职位名称听起来依然模糊,但其职责却像是一个异常宽泛的产品工程岗位。

@ai_explorer25 总结道(81 个赞、5 条回复、5,004 次浏览、129 次收藏)把 Andrej Karpathy 在 Stanford 的讲座概括为一条从 LLM 到 prompt、再到 agent、loop 和 graph 的演进路径。这条帖子真正有价值的不只是这句口号,而是回复区的讨论:读者表示,多数团队仍停留在 prompt 阶段,只有当 loop 和 graph 在生产环境中开始失效时,才会意识到真正的工程工作从哪里开始。其独特角度在于,它把“graph”视为持久的系统层,而不是可有可无的抽象。

@virgilxbt 指出(41 个赞、6 条回复、1,389 次浏览、35 次收藏)称,Anthropic 免费的 4 小时 Claude 课程把重点放在 prompts、context、workflows、feedback 和 loops 上,而不只是提示词技巧。Claude Academy 上的公开课程页面也支持这一框架:它明确将 Claude、agent skills、MCP 和 applied workflows 设为课程内容。回复进一步提炼出一个教训:真正持久的能力,是捕捉失败、把失败转成测试,再把测试结果反馈回工具和上下文。

@DeepLearningAI 写道(23 个赞、1 条回复、2,113 次浏览、14 次收藏)称,编码 agent 仍然需要人类在 API 设计、会话管理、缓存、异步处理、数据模型、CI/CD 和可观测性等方面提供指导。这让当天关于招聘和课程的讨论更具体了:公开描述中的“AI agent”职业面,依然锚定在经典软件工程决策上,只是对评测和运行时判断的要求更高。

Discussion insight: 这些帖子共同收束到一点:仅有提示词能力,已经不再算得上资历。真正被看重的工作,是选择架构、编写指南和评测、组织工作流,并决定模型应在何处停下、由确定性工具接管。

Comparison to prior day: 8 月 28 日的结论是,构建者需要为 agent 时代重新学习软件基础;8 月 29 日则显示,这些基础正在被包装成岗位、课程和更窄的专业方向。

1.2 可靠性争论集中在 harness、异步环境和显式控制对象上(🡕)

第二个高密度主题认为,agent 的可靠性与其说取决于基础模型,不如说取决于其周围环境、记忆、验证机制和对象模型。至少有五条信息支撑这一主题:Meta 的 Gaia2/ARE 论文总结、一张上下文工程图、关于确定性 hooks 的论述、一个五对象路由分类,以及一则直接反对长时间无人值守软件循环的警告。相比 8 月 28 日聚焦遥测和控制器层,8 月 29 日更进一步追问:模型周围到底该设计什么。

@marfinxx 声称(42 个赞、8 条回复、2,260 次浏览、46 次收藏)称,Meta 的 Gaia2 基准显示,静态评测会漏掉真实世界中的 agent 失效,因为生产环境里的 agent 要面对异步事件、时间约束、噪声和多 agent 协调。附带的论文封面之所以重要,是因为它直接展示了 ARE 平台和 Gaia2 的预算扩展曲线;而 Gaia2 论文 和 ARE 仓库 上的公开补充信息,也印证了这种“动态环境”框架。@PrecipitateAI 的一条回复又给出了实践者版本的同样结论:在跑了 110+ 个无人值守 cron 作业之后,真正关键的失败来自时序竞争和锁过期,而不是最终答案明显错误。

Meta ARE 和 Gaia2 论文封面,展示异步智能体环境和预算扩展曲线,用以论证静态基准无法捕捉现实世界中的失效模式

@pauliusztin_ 展示了(31 个赞、1 条回复、523 次浏览、19 次收藏)展示了一张紧凑的上下文工程图:每一次模型调用,都会由 system prompt、历史记录、用户事实、检索事实、工具 schema、长期记忆、数据库和 MCP 服务器重新组装。这张图提供了独特证据,因为它把隐藏的组装过程可视化了:短期 prompt 只是更大记忆与工具流水线中的一部分。这支持了当天更广泛的判断:agent 工程越来越是在管理每一轮究竟把哪些东西组装到模型周围。

上下文工程示意图,展示如何从工具模式、检索到的事实、用户事实、长期记忆、数据库和 MCP 服务器组装短期提示

@AtMemX 指出(10 个赞、10 条回复、440 次浏览)称,instructions 是概率性的,而 hooks 是确定性的,并举了几个例子:结束时自动跑测试、访问文件前做权限检查、工具调用后写入审计日志,以及测试失败时阻止完成。@nykdotdev 也提出了类似观点(30 个赞、6 条回复、3,066 次浏览、33 次收藏)称,chat、goal、skill、routine 和 hosted worker 是不同对象,不该混为一谈;他在回复中还表示,核心区别在于,goal 需要完成条件,而 chat 只需要给出有用答案。合在一起看,这些帖子把可靠性问题指向了显式运行时对象和事件驱动的强制执行,而不是更好的措辞。

@fjzeit 提出异议(19 个赞、5 条回复、1,002 次浏览)讨论了“无人值守的 spec-to-code 循环是否会成为严肃软件工程的长期答案”这一观点,并提出反驳,主张采用有人参与、有人引导的开发方式,并加强人类控制。关键在于,这种反驳并不是否定 AI 辅助开发,而是否定“自主性本身就是持久产品形态”这一假设。

Discussion insight: 更有力的回复并没有说当前 agent 毫无用处,而是指出,脆弱点几乎总在原始答案之外:对象身份、完成条件、调度、状态延续、锁、hooks,以及 agent 思考时环境是否仍在变化。

Comparison to prior day: 8 月 28 日强调的是遥测、轨迹和控制器;8 月 29 日则延续了这种系统视角,但把它翻译成了更具体的设计规则:动态基准、prompt 组装、确定性 hooks,以及 chat、goal、skill、routine 和 hosted worker 之间的明确区分。

1.3 买方按运行时经济性、路由纪律和供应商冗余来评估 agent 系统(🡕)

另一个强势主题把 agent 产品看作带有预算、缓存、云端 workers 和回退路径的操作系统,而不是简单的模型封装。至少有四条信息支撑这一主题:一篇详细的 Devin 评测、Uber 的软件工厂指标、一则混合开放模型路由帖,以及一则关于模型依赖带来供应商风险的警告。相比 8 月 28 日讨论 harness ROI 和云端软件工厂,8 月 29 日更深入地进入了路由和韧性问题。

@Da7_Tech 报道称(236 个赞、74 条回复、27,456 次浏览、158 次收藏)称,在高强度使用 Devin Max 后,他可以在一个 500,000 词的任务上同时运行 17 个以上的 Sol Max agents,同时只消耗了 4% 的额度;其中一次大约 10 亿 token 的工作负载,缓存占比约达 95%。帖子还给出了买方在基准测试之后真正关心的产品控制细节:云端 agents 拥有自己的机器、CLI 行为稳定、指令遵循能力强,但使用情况可见性较弱;而且上层 steering message 可能取消 subagents,也没有真正的 goal mode。这是当天最好的例子之一,说明用户评估 agent 技术栈时,看的其实是运行时和 UX 表面,而不只是模型品牌。

Devin 云端智能体会话,展示托管机器及其机器规格,说明了为何评测中将远程执行视为一项重大优势

@UberEng 报道称(33 个赞、4 条回复、6,371 次浏览、37 次收藏)称,Uber 各类 agentic 工具的周活跃用户增长了 7 倍,周 agent 请求量增长了 9.4 倍,而 AI 总支出趋于稳定。链接中的 Uber Engineering 文章 补充了更丰富的背景:超过 70% 的 pull requests 归因于本地或云端 agents,团队构建了 3,600+ 个 agent skills,并且每天执行 30,000+ 次 agent-skill runs,同时用用户、会话、轮次、请求、tokens 和价格来衡量支出。其独特之处不在于 Uber 用了 agents,而在于它把 agent 的成本结构视为一个可拆解的工程方程。

@omarsar0 指出(22 个赞、5 条回复、3,679 次浏览、20 次收藏)称,开放模型或本地模型配合自调优 skills,已经足以应对许多重复性自动化任务,因此可以把前沿模型预算留给研究和创意工作。@effiekav 进一步扩展了这一点(60 个赞、12 条回复、497 次浏览)称,对单一供应商的依赖已经成为平台风险;构建者需要路由和备用提供商,因为模型访问会随着他们无法控制的商业事件而变化。合起来看,这些内容表明市场正在走向混合路由,而不是忠于单一模型。

Discussion insight: 这些帖子的回复不断围绕同样的现实检验打转:每周额度是否撑得住?人类能否在不打断子任务的情况下进行引导?哪些任务值得用昂贵模型?关键供应商如果消失,会发生什么?

Comparison to prior day: 8 月 28 日聚焦缓存经济性、云托管工厂和模型选择;8 月 29 日则保留了这些关注点,同时加入了更鲜明的路由纪律:重复性工作用便宜的开放模型,更难的任务用前沿模型,并在供应商变化时明确规划回退方案。

1.4 加密原生的 agent 商业讨论依旧高热,但具体层面仍是信任与结算(🡒)

agent 经济这条线仍是数据集中最响亮、也最持续的话题之一,但最具体的论断依然集中在身份、从报价到交付的工作流、托管和声誉,而不是广泛的主流部署。支撑这一信号的,是反复出现的 TermiX 相关帖子,包括官方表述和一份详细解释生命周期的社区帖。与 8 月 28 日相比,这一主题依然活跃,但方向变化不大。

@termix_ai 将其界定为(110 个赞、4 条回复、56,722 次浏览)把未来描述为“there's an agent for that”,并对比了仍需要人工操作的应用,与那些能完成工作、交付后获得报酬的 agents。@sumonrazamd17 从运营层面给出了论证(11 个赞、13 条回复、103 次浏览)则更具体地拆解了一个流程:任务发现、报价、托管、交付承诺、争议解决、结算,以及声誉更新。Agent.family 的公开主页支持了这一更窄的论断:agents 按链上声誉排序,每个分数都可追溯到一项已结算且可被质疑的任务。

Discussion insight: 即便是支持者的回复,也不是在庆祝泛泛的“AI + crypto”叙事,而是在不断把难点收束到证明、声誉、争议由谁裁定,以及 agent 如何充分证明自己已完成交付、从而值得获得报酬。

Comparison to prior day: 8 月 28 日同样集中在信任、证明层级和授权;8 月 29 日延续了同一论点,更多是重复而不是扩展,这说明该话题依旧热闹,但仍主要集中在加密原生圈层。


2. 什么让人沮丧

长时间自主运行仍会在时间、状态和完成条件上出错

最尖锐的可靠性挫败在于,无人值守 agent 经常失败,是因为模型思考时环境仍在继续变化。@marfinxx 总结道(42 个赞、8 条回复、2,260 次浏览、46 次收藏)把 Meta 的 Gaia2 结果视为证据,说明静态基准会漏掉时间约束、噪声背景事件和多 agent 协调失效;有一条回复则称,真实的无人值守 cron 作业失败时,问题通常出在时序竞争和锁过期,而不是输出明显错误。@AtMemX 指出(10 个赞、10 条回复、440 次浏览)称,当模型会直接忘记规则时,AGENTS.md 里的规则本身并不够;@nykdotdev 表示(30 个赞、6 条回复、3,066 次浏览、33 次收藏)则称,很多团队仍把 chat、goals、skills、routines 和 hosted workers 混在一起,没有明确的完成条件。@fjzeit 明确指出了其后果(19 个赞、5 条回复、1,002 次浏览)指出:无人值守的 spec-to-code 循环,对严肃软件工作而言仍然太脆弱。严重程度:高。值得投入建设:高。

运行时价值仍难判断,因为模型质量、缓存行为和供应商风险会一起变化

第二个挫折来自经济与运营层面:买方仍无法把模型能力,与 harness 设计、缓存效率、UX 质量和供应商依赖清晰分开。@Da7_Tech 报道称(236 个赞、74 条回复、27,456 次浏览、158 次收藏)称,Devin 的效率明显高于竞品订阅,但仍指出缺少 goal mode、使用情况可见性弱,以及 steering 行为可能取消 subagents。@UberEng 报道称(33 个赞、4 条回复、6,371 次浏览、37 次收藏)称,即使在 Uber 这样的规模下,答案也不是单一分数,而是一整套涵盖用户、会话、轮次、请求、tokens 和价格的成本方程。@effiekav 补充道(60 个赞、12 条回复、497 次浏览)称,当供应商关系变化时,模型访问本身也可能变得不稳定;而 @omarsar0 描述道(22 个赞、5 条回复、3,679 次浏览、20 次收藏)则显示,团队已经在进行人工路由,以控制支出。严重程度:高。值得投入建设:高。

“agent”这个词仍掩盖了太多不同的工作、角色和产品表面

当天关于岗位和分类的帖子也暴露出一个语言问题。@NickADobos 表示(305 个赞、39 条回复、18,936 次浏览、275 次收藏)称,尽管工作已覆盖提示词、harness 设计、MCP、记忆、评测和企业产品交付,但他们团队仍不知道该如何准确命名正在招聘的岗位。@nykdotdev 指出(30 个赞、6 条回复、3,066 次浏览、33 次收藏)称,chat 不是 goal,skill 也不是 routine;@ai_explorer25 概括了(81 个赞、5 条回复、5,004 次浏览、129 次收藏)的回复则表示,很多团队停在 prompt 阶段,却把其余一切都叫做“agents”。这里的挫折不只是命名问题。它还让招聘、产品范围界定和评测变得更难,因为团队常常在同一个标签下比较本质不同的东西。严重程度:中。值得投入建设:中。

agent 商业在“证明、托管和声誉”之外,仍缺乏更广泛信心

这条加密原生线索依然活跃,但其中最强的帖子仍然是在讨论信任基础设施,而不是已经被验证的主流需求。@sumonrazamd17 描述道(11 个赞、13 条回复、103 次浏览)描述了 agent 工作从报价到托管、交付、争议、结算的流程,而 Agent.family 则称,每个评分都可追溯到一项已结算且可被质疑的任务。这比普通的市场宣传更具体,但也暴露出其中的摩擦:如果头号卖点仍然是证明、争议处理和声誉,那么默认的 agent-to-agent 商业显然还没建立起足够信心。严重程度:中。值得投入建设:中。


3. 人们希望出现什么

一层能在异步现实中可靠运作的确定性工作流

最明确的需求,是有一层能把“记得做这件事”变成强制执行规则的系统。@AtMemX 指出(10 个赞、10 条回复、440 次浏览)希望有 hooks 能自动跑测试、检查权限并阻止完成;而 @nykdotdev 表示(30 个赞、6 条回复、3,066 次浏览、33 次收藏)则指出,goal 需要明确的完成条件,hosted worker 也应有不同于 chat 的生命周期。@marfinxx 文章 中对 Meta Gaia2 的讨论又增加了紧迫性:时间、噪声和后台事件会制造静态测试永远看不到的失败模式。现有 harness 今天已经部分覆盖这一问题,但这里的需求是更持久、也更一等公民化的能力。机会:直接。

更清晰、共享的 agent 产品、岗位与可复用工作单元分类

多条帖子都暗示,市场仍缺少一套清晰词汇,来描述到底在构建什么、又在招聘什么。@NickADobos 表示(305 个赞、39 条回复、18,936 次浏览、275 次收藏)称,随着工作变得更具体,他们团队反而越来越不知道该给这个岗位起什么名字;@ai_explorer25 文章 和 @virgilxbt 文章 则都把真正持久的工作定义为 loops、graphs、context、workflows 和 feedback,而不是 prompts。这是个很实际的需求,因为名词不清,会让 agent 系统更难采购、教学和评估。课程和公开图示正在提供帮助,但还远远不够。机会:直接。

内置冗余的混合模型路由基础设施

运行时相关帖子里最强烈的产品愿望,不是“给我一个更好的模型”,而是“给我一套值得信任的路由”。@omarsar0 描述道(22 个赞、5 条回复、3,679 次浏览、20 次收藏)主张,把重复性自动化任务转移到开放/本地模型上,把前沿模型预算留给更难的工作;而 @effiekav 指出(60 个赞、12 条回复、497 次浏览)则指出,供应商回退方案如今已成必需,因为提供商关系可能突然变化。Uber 的 software-factory 文章 展示了大公司内部的一种部分答案,但这一需求依然广泛且具有重要商业意义。机会:直接。

易于发现、检查和信任的可复用 skills

当天出现了多个信号,表明人们想要的是模块化能力,而不是单体 agents;但在安装或调用之前,他们也希望有更高的信心。@tom_doerr 分享了(27 个赞、2 条回复、2,669 次浏览、21 次收藏)介绍了作为 163 个工作流研究包的 Scientific Agent Skills,@AIPandaX 分享了(9 个赞、3 条回复、553 次浏览)介绍了可供 agents 通过 MCP 查询的代码图层 GitNexus,@vibelancer 强调了(39 个赞、3 条回复、220 次浏览、11 次收藏)则介绍了安装前审查 skills 的扫描器 SkillSpector。现实需求已不再只是“更多 skills”,而是更安全的发现机制、更清晰的元数据,以及更有力的证据证明某个 skill 确实完成了它声称的工作。机会:竞争性。

面向交易型 agents 的可移植信任与结算模块

这条商业线索表明,人们持续希望看到的是可复用的信任基础设施,而不是一个个孤立市场。@sumonrazamd17 描述道 描述了一套涵盖报价、托管、交付承诺、争议、结算和声誉更新的生命周期,而 Agent.family 则把分数表述为“可被质疑的任务历史”。这读起来像一种切实的产品需求:身份、证明、托管和争议处理应能跨 agent 框架迁移复用,不过目前证据仍偏早期,且主要来自加密原生领域。机会:竞争性。


4. 正在使用的工具与方法

工具 类别 情绪 优势 局限
Devin 编码 agent harness (+/-) 一位高强度用户的评测显示其缓存效率高、云端 agents 拥有自己的机器、CLI 稳定、指令遵循能力强 缺少 goal mode、使用情况可见性弱,且父级 steering 可能打断子任务
Uber Software Factory 技术栈 Agent 运营平台 (+) 3,600+ 个可复用 skills、30,000+ 次日执行、MCP gateway、context graph,以及明确的成本拆解 证据来自一套高度依赖定制基础设施的内部技术栈
混合开放/本地模型路由 路由方法 (+) 可降低重复性自动化任务成本,并为更难的研究或创意工作保留前沿模型预算 需要定制 skills、严格的评测纪律,以及人工路由决策
上下文工程 + hooks Harness 方法 (+) 从记忆、检索事实和工具 schema 重新组装 prompts,并用确定性 hooks 执行必须运行的检查 额外工程工作位于模型之外,需要独立维护
Scientific Agent Skills 领域技能库 (+) 163 个 workflows、100+ 个科学数据库,并支持 Cursor、Claude Code、Codex 和 Google Antigravity 等多种客户端 最适合研究密集型工作;效果仍依赖兼容客户端与工具配置
GitNexus 代码图 MCP 层 (+) 为 agents 提供依赖图、调用链、结构化查询和基于浏览器的仓库探索 公开部署看起来仍比普通聊天工具更重,需要索引和 MCP 配置
SkillSpector 技能安全扫描器 (+) 把 skill 安装当作审查问题处理,并在安装前扫描漏洞 在一个仍缺乏标准信任信号的市场里又增加了一道审查步骤
Agent.family / TermiX Agent 商业基础设施 (+/-) 明确提供声誉、报价、托管、结算和可被质疑的任务历史 多数证据仍来自加密原生宣传,而非圈外广泛使用

当工具能把稳定逻辑从隐藏的 prompts 中移出来,放进可见结构——成本面板、skills、hooks、graphs、声誉账本或 hosted workers——时,整体满意度最高。常见的权宜模式也很清楚:重复性任务使用更便宜的开放/本地模型,更难的工作路由到前沿模型,显式管理上下文组装,并在信任输出之前加上验证或安全关卡。迁移压力正在把市场从“单模型”或“单聊天”思维,推向结合路由、记忆、skills、hooks 和审计界面的分层技术栈。


5. 人们在构建什么

项目 构建者 功能 解决的问题 技术栈 阶段 链接
Uber Software Factory @UberEng 覆盖软件开发与维护的内部托管 agent 系统 让 Uber 在扩大 agent 使用规模的同时,衡量并降低每次请求和每个会话的成本 托管 agents、MCP gateway、context graph、可复用 skills、prompt caching、成本监测 已发布 文章 · 博客
Scientific Agent Skills / K-Dense BYOK @tom_doerr 分享 K-Dense 为 agents 提供 163 个可复用科学 workflows,以及本地 co-scientist 路径 提供领域专属的研究流程,而不是让 agents 从零即兴拼凑科学工作流 Python、Agent Skills / Agent Plugins 标准、100+ 个科学数据库、支持 40+ 模型的 BYOK workspace 已发布 文章 · 仓库
GitNexus @AIPandaX 分享 Akon Labs 把代码仓库变成 agents 可通过 MCP 查询的知识图谱 通过暴露依赖关系、调用链、架构和影响面,避免盲改代码 JavaScript/TypeScript、Tree-sitter 解析、MCP server、浏览器 UI、知识图谱索引 已发布 文章 · 仓库
SkillSpector @vibelancer 展示 NVIDIA 的项目 在安装前扫描 agent skills 的漏洞 为快速增长的 skills 生态增加类似供应链的审查能力 Python、静态分析、可选 LLM 评估、JSON/Markdown/SARIF 报告 已发布 文章 · 仓库
OpenGrok 实时语音与模型路由器 @OnlyTerp 让 Grok Bot 用户可为不同 agents 绑定不同模型,并加入实时语音控制 修复 harness 不匹配问题,让持久 agents 更易操控,同时不必把密钥交给供应商 供应商专属模型映射、本地密钥保管、Grok Bot 集成、本地语音面板 Beta 文章 · 仓库
Agent.family / TermiX @termix_ai 生态 让 agents 可被发现、报价、托管、质疑和支付的市场与信任层 当 agents 需要彼此完成工作时,提供身份、声誉和结算基础设施 链上声誉、报价流程、托管、交付承诺、争议挑战、稳定币结算 Beta 文章 · 网站

最成熟的构建信号来自 Uber:其公开博客把 agent 使用与运营指标直接挂钩,而不是停留在发布话术上。博客称,目前超过 70% 的 pull requests 归因于本地或云端 agents,工程师也已创建出 3,600+ 个可复用 skills,每天执行 30,000+ 次。之所以值得注意,是因为这把 agent 工作框定为一个可观测、可度量的内部平台,而不是附属式助手。

K-Dense 和 GitNexus 则展示了另一种同样重要的构建模式:把模型周围缺失的上下文打包出来。Scientific Agent Skills 把研究工作流做成 163 个 skills 和 100+ 个数据库组成的可复用资产;GitNexus 则把代码结构变成可查询的图,让 agents 在编辑前先检查依赖关系。两者都在试图减少 agent 在运行时必须进行的盲目推理。

Scientific Agent Skills 仓库截图,展示了 163 项技能、100 多个数据库、跨客户端兼容性,以及 K-Dense 的 BYOK 本地协作科学家路径

SkillSpector 和 OpenGrok 指向了一个不断增长的 agent 二阶工具市场。前者在安装前为 skills 做安全把关;后者重新映射供应商特定的模型行为,并在本地保管密钥的同时加入语音控制。TermiX 和 Agent.family 则把这种“打包”冲动延伸到了商业层面:它们不只是让 agent 存在,而是试图给 agent 配上可事后检查的声誉、报价、托管和结算表面。


6. 新变化与值得注意之处

“Model Behavior” 成了公开招聘标签

@NickADobos 使用(305 个赞、39 条回复、18,936 次浏览、275 次收藏)以“Model Behavior”替代“Prompt Engineering”,这是一个值得注意的信号,因为它反映出一家真实公司正在围绕模型输出、工具、记忆和评测,重新命名这类工作。这类职位名称的变化通常滞后于实践,因此它开始出现在公开招聘语言中,说明劳动力市场正在追上团队内部早已形成的认知。

动态 agent 基准继续走出静态沙盒

@marfinxx 呈现了(42 个赞、8 条回复、2,260 次浏览、46 次收藏)介绍了 Meta 的 Gaia2 / ARE 框架,指出异步且持续变化的环境会暴露静态基准看不到的失败。这一点很重要,因为它给可靠性讨论提供了一个比泛泛而谈“真实世界就绪”更具体的公开基准目标。

skills 生态既在加深,也在加门槛

@tom_doerr 分享了(27 个赞、2 条回复、2,669 次浏览、21 次收藏)介绍了一个包含 163 个 workflows 的科学 skill 包;@vibelancer 强调了(39 个赞、3 条回复、220 次浏览、11 次收藏)则介绍了可在安装前扫描 skills 的 SkillSpector。再配合这条 AIPandaX 文章 中的 GitNexus,可以看到一个值得注意的变化:周边支持市场正变得更具体,不只是更多 agents,而是更好的上下文包、仓库图谱和安装前安全检查。


7. 机会在哪里

[+++] Deterministic agent operations layers — Evidence from @AtMemX 文章、@nykdotdev 文章、@marfinxx 文章,以及 Uber 的 software-factory 文章 都指向同一个方向:hooks、完成条件、异步安全执行、重试和显式生命周期对象,仍然供给不足且具有重要商业价值。

[+++] Hybrid routing and provider-failover control planes — @Da7_Tech 文章、@omarsar0 文章,以及 @effiekav 文章 表明,市场已经在围绕缓存效率、基于任务的模型选择和供应商冗余做优化。能让这些路由决策既可观测又安全的系统,看起来是一个强劲的近期机会。

**++] 技能发现、检查与安全基础设施** — K-Dense 的 [Scientific Agent Skills、GitNexus,以及 NVIDIA 的 SkillSpector,都在从不同角度解决同一个结构性需求:找到正确能力、理解它能做什么,并在 agent 使用之前建立信任。

**+] 面向智能体间协作的可移植信任护栏** — TermiX 和 [Agent.family 持续把身份、托管、交付证明和声誉推到“必要基础能力”的位置上。机会真实存在,但今天的证据仍更像一个早期、加密原生的市场,而不是广泛跨行业的需求曲线。


8. 要点

  1. AI agent 工作正在变成一个招聘类别,而不再只是某种氛围。 Dia 的招聘帖和 Anthropic/Karpathy 的课程讨论,都把模型行为、harness 设计、工作流和评测当成明确的岗位表面,而不是提示词技巧。(来源)
  2. 关于可靠性的讨论进一步远离静态 prompts,转向环境、hooks 和生命周期设计。 Gaia2 / ARE 讨论、上下文工程图和确定性 hooks 论述都指向同一个结论:脆弱部分通常在基础模型之外。(来源)
  3. 运行时经济性和模型路由,如今已成为产品本身的一部分。 Devin 对缓存和 UX 的详细评测、Uber 的成本方程,以及混合开放模型路由建议,都显示买方关心的不只是表面的智能水平,还包括额度能否撑住、云端 workers、缓存比例和回退路径。(来源)
  4. agent 周边生态正变得更加模块化。 科学 skill 包、代码图 MCP 层和 skill 扫描器都表明,可复用能力及其安全检查正在形成独立市场。(来源)
  5. agent 商业仍是一个持续存在、但依旧狭窄的前沿。 当天最强的证据仍集中在证明、托管、争议流程和声誉,而不是广泛的主流 agent 支出。(来源)