跳转至

Twitter AI Coding - 2026-08-03

1. 人们在讨论什么

1.1 开放权重前沿模型之所以重新变得有意思,是因为 Qwen 把价格、基准测试和可续跑循环绑在了一起 (🡕)

今天数据里最明显的爆点,是 Qwen3.8-Max。多条帖子都不再把它当成又一个基准测试发布来谈;真正的信号来自这个组合:下周开放权重、每百万 token 2 美元 / 6 美元的明确价格,以及长时程自主编程能力的宣称——这些东西都能直接被转译进人们自己的智能体工作流。至少有 4 条高信号内容反复强化了同一个主题,而后续讨论的重点也越来越偏向带检查点的执行方式,而不只是参数规模。

@Alibaba_Qwen 宣布(1,461 点赞,124 回复,53,679 浏览,250 收藏),Qwen3.8-Max 是一个 2.4T 参数模型,支持 10+ 天自主编程、500+ turn 的芯片设计优化,并将在下周同时开放 Qwen3.8-Max 和 Qwen3.8-27B 的权重。配套的基准测试图让这条帖子比普通发布串更有分量:图里给出了 Qwen3.8-Max 在 TerminalBench 2.1 上的 86.6、在 PaperBench 上的 93.0,以及它在 SWE-Pro、FrontierSWE、CoWorkBench 和 OSWorld-Verified 等任务上的成绩。推文还把价格明确写进了卖点里:每百万 token 输入 2 美元、输出 6 美元。

Qwen 发布中的基准测试表,展示 Qwen 3.8-Max 在 TerminalBench、PaperBench、SWE-Pro、FrontierSWE 等任务上的宣称成绩

@codeglitch 认为(2 点赞,2 回复,122 浏览),Qwen 这次发布里真正可复用的部分,不是模型尺寸,而是围绕长时程编程任务建立的检查点结构。配图把这条循环压缩成了 issue -> change -> check -> state,并且明确把它映射到 Claude Code 风格的 DONENEXTBLOCKED 交接。这让一段厂商 demo,直接变成了一条可执行的工作流建议。

检查点幻灯片,把一次长时程智能体循环概括成 issue、change、check 和 state

讨论要点: 官方的 Qwen 回复串主要是在继续补证据:LM、VL,以及 16 天编程等后续材料;但社区里最有价值的反应,已经转向了可检查性。人们真正反复提取出来的,是如何把一场马拉松式运行拆成一系列小而可验证的状态。

与前日对比: 8 月 2 日主要由网关、免费层和路由层主导。到了 8 月 3 日,Qwen 带着开放权重时间点、明确价格,以及工作流可直接复用的产物,把模型层又重新推回了舞台中央。

1.2 围绕 Codex 的帖子,开始从“写代码”转向“运行产品和文档工作流” (🡕)

今天最重要的 Codex 帖子,并不是在谈编程基准测试,而是在谈运营工作。产品管理、广告投放、文档处理和应用脚手架,反复出现同一种模式:用户把 Codex 当成一个能运行有边界的业务流程、并在审批点停下来的工作者,而不是自动补全界面。

@thsottiaux 声称(1,639 点赞,338 回复,181,614 浏览,115 收藏),你可以“让 Codex 凭空生出一个 PR,并把一个改进发布给 10 亿用户”,这条话是从一个很小的 OpenAI 拉取请求引出来的。回复里的有价值反驳也紧随其后:多位用户抱怨压缩聊天和图像故障、信用额度消耗过快,以及 Pro 5x 配额根本撑不满一整天。也就是说,头条能力背后同时绑着非常现实的操作成本和可靠性上限。

@gdb 放大了(320 点赞,44 回复,48,509 浏览,172 收藏)一个 Codex 技能:把支持工单、访谈、问卷和流失反馈,转成一份有证据支撑的路线图。那条引用推文把原始客户表述、底层问题、下一步该验证什么,以及哪些说法能诚实地写出来,拆得很清楚;而回复立刻指出了更难的地方:难点并不在于聚类抱怨,而在于判断最吵的客户,是否也是最有战略价值的客户。@gdb 还重点提到(84 点赞,12 回复,11,338 浏览,32 收藏)第二种工作流:Codex 会裁切并发布一条广告活动、构建受众、设置预算,并在付款步骤前停下来等待审批。

@github 报告了(115 点赞,13 回复,26,637 浏览,70 收藏)今天最具体、可量化的案例:Aspire 团队借助 GitHub 智能体式工作流,创建了 82 个跨仓库文档 PR,82 个全部合并,中位合并时间为 44.8 小时。配套的文章补上了关键机制:只创建草稿 PR、使用带作用域的 GitHub App 权限、安全输出,以及 SME 审查,而不是让系统自主合并。@waynesutton 则补充了(26 点赞,2 回复,2,139 浏览,16 收藏)一个规模更小、但模式相同的案例:Codex Sites + Convex skill 会明确把前端发布和后端状态管理隔离开,防止两者互相串味。

讨论要点: 最实质性的分歧,并不在于这些工作流厉不厉害,而在于控制权。gdb 那条帖子下的回复追问的是,路线图技能该如何在“最吵的反馈”和“最有战略价值的反馈”之间权衡;GitHub 那条帖子下,大家把人工审查视为决定性的护栏;而那条最出圈的 Codex 成功帖,也几乎立刻就被配额和 bug 抱怨淹没了。

与前日对比: 8 月 2 日还在抽象地讨论运行框架。8 月 3 日则把这套运行框架,直接绑定到了文档 PR 合并时间、审批闸门,以及可复用的业务工作流这些可量化结果上。

1.3 技能、运行框架与编排表层,继续被打包成可安装产品 (🡒)

8 月 2 日的运行框架叙事并没有消失,只是变得更像产品。今天的帖子把技能当成一种产品类别、把运行框架选择当成架构决策,并把编排与审查工具变成了一个公开可见的仓库簇,而不再只是隐藏的落地细节。

@FlowAltDelete 认为(30 点赞,2 回复,2,383 浏览,24 收藏),Copilot Studio 现在已经迫使制作者在两种运行框架里二选一:Standard 适合结构化对话,GitHub Copilot 适合长时程业务流程。配套的 Microsoft 引用公告 和回复把约束说得很具体:GitHub Copilot 这一运行框架的工作会消耗 Copilot Credits,这个选择之后不能再迁移,而且大家已经在担心缺少计费护栏。

@about_hiroppy 提到了(10 点赞,1,253 浏览,5 收藏)Microsoft 的 Skill Recorder。它的仓库说明:一次录下来的真实屏幕会话,可以通过 GitHub Copilot CLI 被转成一个可复用的技能或自动化流程。@AIatAMD 介绍了(55 点赞,3 回复,2,105 浏览,12 收藏)AMD Skills,把它定位成适用于 Cursor、Claude Code、Codex 和 Gemini CLI 的可安装技能目录;@tom_doerr 则提到了(1 点赞,1,028 浏览)mimeographs,这是一个由 SKILL.mdAGENTS.md 文件构成、包含 80 个专家角色风格智能体技能的仓库。

@DivyanshT91162 汇总了(109 浏览)同一趋势在仓库侧的表现:mattpocock/skills、OmniRoute、Orca 和 Alibaba 的 open-code-review 一起出现在热门列表里,而抓取到的仓库元数据分别给出了 201,741、38,881、36,743 和 18,493 个 GitHub stars。@akshay_pachaar 又补充了(22 点赞,7 回复,2,106 浏览,25 收藏)框架侧的一个版本:NOOA 认为智能体应该看起来像 Python 类,而不是一堆提示词、模式定义和回调。@__tosh 则展示了(45 浏览),这些表层差异在实际里长什么样——smol、Pi 和 OpenCode 在读取同样 8 个 Python 文件时,会产生完全不同的工具调用形状、token 消耗和延迟轮廓。

执行仪表盘,对比 smol、Pi 和 OpenCode 在同一项 8 文件读取任务中的工具计数、token 消耗和延迟

讨论要点: 回复大多围绕可操作性,而不是原始模型质量。NOOA 的回复赞赏它摆脱了“50 different yaml files”,但也担心继承层级和规模扩张;而热门仓库汇总下最有传播力的一条回复,则说真正重要的不是再多几个工具,而是安装能力和 marketplace 式分发。

与前日对比: 8 月 2 日只是概念性地勾勒出运行框架栈。8 月 3 日则把同一套栈推进到了技能市场、工作流录制器、仓库汇总,以及人们真的可以安装的框架抽象里。

1.4 关于信任与安全的抱怨,不再像纸上谈兵 (🡕)

本周前几天一直在说的“验证”主题,今天终于落到了具体案例上。数据里不再只有关于独立 verifier 层的抽象争论,而是同时出现了运行时控制产品、被阻断的安全工作流,以及一条直接的数据丢失抱怨。信任问题现在正在同时表现成一种产品类别,也表现成一种客服负担。

@_ar9av 展示了(19 点赞,7 回复,576 浏览)Prismor,把它定位成一个运行时控制平面,能在 Claude Code、Codex、Copilot 和框架 SDK 之上,拦截破坏性命令、密钥外泄和提示词注入。它的 仓库 README 与推文说法一致:支持观察模式、HITL 审批和 MCP gateway;但回复几乎立刻就开始追问误报、回滚语义,以及随着仓库不断变化,策略到底由谁维护。

@paulbrigner 报告了(163 浏览)另一种方向上的失效:Codex Security 拒绝扫描他自己的 diff,界面弹出的是 Trusted Access(可信访问)提示,而不是按要求执行保护性检查。@zero_dovel 则报告(3 回复)了一个严重得多的结果:一条 Antigravity 命令几乎把一台 Windows 机器清空了;配图展示的是一个几乎空白的用户目录,虽然在采集时这仍是一条单方抱怨。@stas_sorokin_ 认为(82 浏览),vibe coding 和智能体式工程的区别,不是模型本身有多聪明,而是在信任之前先做验证。

Codex Security 阻止 diff 扫描,并显示 Trusted Access 警告,而不是运行请求中的安全检查

讨论要点: Prismor 那条帖子下的回复,把这种张力说得很清楚。人们想要一层能统一覆盖 MCP servers 和工具调用的策略层,但也期待这层东西既不会误伤合法 shell 工作,也不会把智能体困进根本不可用的审批循环里。

与前日对比: 8 月 2 日强调的是“验证”作为设计原则。8 月 3 日则补上了被阻断的扫描、运行时策略产品,以及一条非常具体的数据丢失抱怨,让信任缺口更难再被轻描淡写。


2. 令人困扰的问题

安全边界正在朝两个方向同时失效

严重程度:高。@paulbrigner 报告(163 浏览),Codex Security 连他自己的 diff 都不愿扫描,而是显示 Trusted Access(可信访问)提示,拒绝执行本该提供保护的检查。@zero_dovel 则报告(3 回复),一条 Antigravity 命令几乎把一台 Windows 机器清空,配图里是一个几乎空白的用户目录,虽然在采集时这仍是单方说法。@_ar9av 之所以在卖(19 点赞,7 回复,576 浏览)Prismor,正是因为它想覆盖这一类失效带:破坏性命令、密钥外泄、提示词注入,以及高风险工具调用的审批闸门。链接中的 AISLE 披露 又提供了外部证据,说明这些担忧不是假设:它记录了 Cursor、VS Code 和 Google Antigravity 会因为恶意 commit message 链接而出现一键 RCE 路径。今天可见的应对方式,是额外加一层明确的策略平面,或者干脆重新考虑哪些任务该留在封闭托管表层里。这非常值得围绕它构建产品。

配额悬崖和模型锁定,依然在塑造日常工具选择

严重程度:高。围绕 @thsottiaux 讨论 Codex 的帖子(1,639 点赞,338 回复,181,614 浏览,115 收藏)下的回复,很快变成了对压缩聊天和图像故障、信用额度消耗过快,以及 Pro 5x 配额“根本撑不满一整天”的连续抱怨。@JustMicrock 抱怨(8 点赞,4 回复,374 浏览),OpenAI 依然是每天的默认选择,因为竞争对手要么暂停订阅、要么额度不可比、要么限制模型能在哪些地方被调用——其中还包括 Google 在 Antigravity CLI 之外的 OAuth 限制。@FReza1984 则把(93 浏览)OmniRoute 描述成解决同一问题的基础设施:既然提供商频繁变化、免费层会耗尽、模型经济性也不断波动,那么与其忠诚,不如路由。帖子本身已经把应对模式说得很明白:跨提供商路由、在 OpenCode 这类表层里寻找更便宜或免费的模型,并把昂贵权限留给那些真的需要它的任务。这非常值得围绕它构建产品。

现有智能体表层,依然把简单任务做得风格差异过大

严重程度:中。@__tosh 展示了(45 浏览),3 个智能体读取同样 8 个 Python 文件时,会跑出完全不同的工具调用形状、token 计数和延迟画像。@0xQuantic 则从操作者角度概括了(14 点赞,4 回复,656 浏览)同样的摩擦:Hermes + Codex 最简单,Claude Code 在某些具体任务上有帮助,云端智能体主要对软件工作有希望,而本地模型在普通硬件上依然令人失望。@akshay_pachaar 重点提到(22 点赞,7 回复,2,106 浏览,25 收藏)NOOA,很大程度上正是把它当成一种逃离提示词文件、工具模式、回调和工作流图的办法。今天的权宜方案,是把栈尽量缩窄到一个配对或一个可预测的框架,而不是去信任整个类别。这非常值得围绕它构建产品。


3. 人们期望的功能

一层既能检查高风险代码、又不会拦住正当防御工作的信任层

实际需求。最强的证据,正来自两个方向的对比:一边是 @_ar9av 在卖(19 点赞,7 回复,576 浏览)一个运行时控制平面,另一边是 @paulbrigner 却连自己的 diff 都扫不动(163 浏览)。AISLE 披露和 Antigravity 的数据丢失抱怨说明,人们确实想要审批、拒绝规则和审计轨迹;但那条被拦住的扫描也说明,大家并不希望这些控制最终反过来废掉正常的自我保护。机会:直接。

能跨工具切换而不失效的可移植技能包与工作流沉淀

实际需求。Skill Recorder@AIatAMD 的 AMD Skills、mimeographsmattpocock/skills,都建立在同一个假设上:可复用的智能体行为,应该能被安装、分享、跨工具迁移,而不是困在某一次聊天或某个演示里。仓库汇总那条帖子下面,最有价值的一条回复也把关键说得很清楚:真正重要的不是再多一些工具,而是技能能通过市场或命令真正装进去。机会:直接。

不受任何厂商主场限制、又更便宜的开放模型访问

实际需求。@Alibaba_Qwen (1,461 点赞,124 回复,53,679 浏览,250 收藏)明确的低价和开放权重时间点摆到了台面上;@JustMicrock 则描述(8 点赞,4 回复,374 浏览)了为什么 OpenAI 事实上成了默认选项:对手要么暂停、要么更弱、要么被平台规则挡在外面;@FReza1984 进一步把(93 浏览)OmniRoute 描述成一种现实答案:当配额、提供商和性价比排名一直在变时,路由要比忠诚更实用。@yacineMTB 又补上了(74 点赞,7 回复,3,657 浏览)这一需求在表层里的版本:OpenCode 的下拉菜单里新出现了一个免费模型,这本身就值得庆祝。机会:直接。

能在用户已经随身携带的设备上工作的远程监督

实际需求。@BenjaminBadejo 展示了(5 点赞,3 回复,2,929 浏览)VoiceClaw:借助 Apple Watch 或 iPhone,经由与 Mac 的直连来启动、引导和检查编程智能体。它的重点不在于“新奇设备”本身,而在于减少人们必须守在原始机器前,等待长时程工作跑完的需求。机会:新兴。


4. 使用中的工具与方法

工具 类别 评价 优势 局限
Qwen3.8-Max LLM (+) 低价、开放权重时间表,以及跨编程任务的强基准测试主张都写得很明确 今天的公开证据,仍然主要来自 Qwen 自己的发布材料和衍生转述
Codex / ChatGPT app 智能体工作区 (+/-) 已经被用于 PR、反馈路线图、广告投放、文档工作流和站点发布 回复串里反复抱怨配额消耗、compressed-chat / image bug、被拦住的安全扫描,以及记忆问题
GitHub 智能体式工作流 工作流自动化 (+) 能在跨仓库文档场景里生成安全输出、做带作用域的 GitHub App 写入,并保留 SME 审查 需要仔细设计分支路由和人工审查机制
Copilot Studio GitHub harness 业务智能体平台 (+/-) 支持长时程工作流、文件、工具、已连接智能体和模型选择 Credits 消耗本身就是设计约束,而且运行框架选择之后无法迁移
技能包(AMD Skills / mattpocock skills / mimeographs) 技能分发 (+) 安装快、知识可复用,而且能做硬件或 persona 专项化 发现、策展和治理,本身正在变成一项新工作
NOOA 智能体框架 (+/-) 用 Python class 来表达智能体模型、类型化合约,以及按引用传递的数据访问 回复里有人质疑它在项目变大后可读性和可扩展性是否还能撑住
Prismor 运行时安全层 (+) 能拦截破坏性调用、secret 外泄和提示词注入,并支持审批 策略调优和回滚语义仍然存在开放问题
OmniRoute 网关 / 路由器 (+) 一个端点覆盖 290+ 家提供商、90+ 个免费层,支持自动回退和 token 压缩 又多加了一层依赖,而且底层质量最终仍受外部提供商影响
OpenCode 开源终端智能体 (+/-) 广泛的模型选择器和持续改进的 UI,让用户愿意继续尝试 同日抱怨集中在 device-code 支持和长会话记忆泄漏
Hermes + Codex 工作方法 (+/-) 一位实操用户认为这是最简单、效率最高的组合 许多用户仍觉得更广泛的云端智能体方案整体上“还没准备好”

没有哪一套栈是绝对赢家。带人工审查的业务工作流,会把人推向 Codex 和 GitHub 托管表层;而成本敏感的实验,则把人推向 Qwen 定价、OmniRoute 回退,以及 OpenCode 的免费模型菜单。

今天的迁移模式是防御性的,而不是意识形态式的:缩窄任务范围、装上技能包、加一个路由器或控制平面,并把人工审批或验证步骤放在任何高成本或高风险动作旁边。OpenCode 的情绪在同一天里明显分裂,而即便是对云端智能体持乐观态度的用户,也仍然把这个类别描述成“最适合有边界的软件任务”,而不是默认万能解。


5. 人们在构建什么

项目 构建者 功能 解决的问题 技术栈 阶段 链接
Startup Feedback Engine @Kappaemme1926 把支持、访谈、问卷和流失反馈转成一份有证据支撑的路线图与客户证明图谱 在嘈杂反馈里决定下一步到底该做什么 Codex skill、evidence IDs、clustering、roadmap scoring 已发布 引用推文信号帖
GitHub Agentic Workflows docs pipeline Aspire team 在产品合并之后,起草跨仓库文档 PR 已发布功能与文档不同步 GitHub Agentic Workflows、安全输出、GitHub App、SME 审查 已发布 文章推文
Codex Sites + Convex @waynesutton 通过一条可复用工作流,构建并发布带实时 Convex 后端的 Codex Sites 避免智能体在前端与后端边界之间猜来猜去或相互漂移 Codex Sites、Convex、可复用技能 已发布 仓库推文
Skill Recorder Microsoft 记录一次真实任务,并把它转成可复用技能或自动化 避免重复手工工作流和脆弱的 UI 回放 桌面应用、GitHub Copilot CLI、Scout / Cowork / Copilot Studio 已发布 仓库推文
Prismor @_ar9av 在智能体工具调用外面再加一层运行时控制平面 约束失控命令、提示词注入和 secret 外流 Python hooks、HITL approvals、Slack / webhooks、MCP gateway、Ed25519 审计轨迹 已发布 仓库推文
AMD Skills @AIatAMD 为编程智能体打包 AMD 专属工作流与最佳实践 避免每个智能体都要重新学习如何在 AMD 硬件和软件上高效工作 Skills CLI、scripts、跨智能体 skill packs 测试版 推文
VoiceClaw Realtime @BenjaminBadejo 从 Apple Watch 和 iPhone 启动、管理并检查智能体 让人可以在离开原始机器时,继续监督长时程工作 Apple Watch / iOS、direct HTTPS、Tailscale / Cloudflare tunnel、双向语音模型 已发布 推文
Farm rainfall planner @DanielSMatthews 预测降雨和土壤条件,用于灌溉与养分规划 根据本地天气和预测数据安排农场计划 Grok Build、Google Antigravity、weather and radar UI 测试版 推文
Mimeographs K-Dense AI 以可安装智能体技能的形式提供 80 个专家 persona 给智能体补上领域启发式和决策纪律,而不只是再多几个工具 Python、SKILL.mdAGENTS.md、Mimeo 已发布 仓库推文

今天最主导性的构建模式,是围绕 AI 编程本身去做元基础设施。Startup Feedback Engine、Codex Sites + Convex、Skill Recorder、Prismor、AMD Skills 和 Mimeographs,全都在试图让下一次智能体运行少一点脆弱性:不是再去发布一个裸聊天界面,而是把流程、领域知识或护栏打包起来。

GitHub 智能体式工作流是这一层已经开始产出可量化结果的最强证明。Aspire 的那条流水线并不只是起草文本;它会在带作用域的权限下创建跨仓库文档 PR,把它们全部保持为草稿,并最终在 SME 审查后让 82 个 PR 全部合并。这比一段 demo 视频的门槛高得多。

VoiceClaw Realtime 和 Farm rainfall planner,则是今天数据里最明显的两个对外案例。前者把手表和手机变成监督智能体的地方,而不是桌面;后者则利用 Grok Build 和 Antigravity,拼出一套面向灌溉和养分时序的运营软件,而不是一款只服务开发者的工具。

VoiceClaw Realtime 画面,展示通过与 Mac 的直连,从 Apple Watch 启动并监控编程智能体会话

天气与降雨规划界面,展示一个农场运营原型中的雷达分析、预测指标与控制面板


6. 新动态与亮点

AI 编程熟练度,直接出现在了付费工程岗位描述里

@LeadHerLogic 发布了(4 点赞,2 回复,1,195 浏览)一个 Turing 岗位,明确要求候选人日常使用 Codex、Claude Code、Cursor、GitHub Copilot 或类似工具。截图还把它具体描述成一份围绕 Python + Docker 的工作,主题是 AI 智能体评估基础设施,报酬结构则是每个任务 300 美元的合同工模式。这比泛泛的“熟悉 AI”要求具体得多,也说明用智能体辅助开发已经成了基础工作流的一部分,而不是可有可无的加分项。

岗位截图,展示一个围绕 Python 与 Docker 的 AI 智能体评估工作,以及每任务 300 美元的合同工模式

“Agentic engineering” 被压缩成了一张先验证、后信任的清单

@stas_sorokin_ (82 浏览)vibe coding 和 agentic engineering 的区别,概括成了上下文、权限、停止条件和证明。它的重要性不在于这个标签本身,而在于这份清单和当天其余帖子高度呼应:被拦住的扫描、运行时安全 hooks,以及在信任生成代码之前必须先有明确验收检查的呼声。

面向编程智能体的 Apple Watch 控制,开始有了像样的产物

@BenjaminBadejo 分享了(5 点赞,3 回复,2,929 浏览)VoiceClaw Realtime:借助 Apple Watch 和 iPhone 的直接界面,启动、引导并检查运行在 Mac 上的智能体。它真正值得注意的地方,不只是“远程终端”这个概念,而是它在尝试让监督、打断和状态检查,适配手边的环境设备,而不是被固定在桌面会话里。


7. 机会在哪里

[+++] 严到足以有意义、松到依然可用的运行时信任层 - Prismor、被拦住的 Codex Security 扫描、Antigravity 的数据丢失抱怨,以及 AISLE 的披露,都指向同一个缺口:团队需要审批、策略和审计层,同时又不能拦住正当的安全与维护工作。

[+++] 可移植的技能与工作流打包层 - Skill Recorder、AMD Skills、mimeographs、mattpocock/skills,以及 Copilot Studio 对运行框架的选择,都说明可复用行为本身正在变成一个产品类别。证据横跨厂商技能包、开源仓库和工作流捕获工具,而不是某个孤立发布。

[++] 带审批意识的业务工作流 - 从反馈到路线图的分析、广告投放执行、文档 PR 自动化,以及 Codex Sites + Convex,都说明市场需要的是那种会在关键节点停下来的有边界智能体工作流,而不是试图把整条业务流程从头跑到尾。

[++] 开放、便宜且带可恢复循环的前沿模型访问 - Qwen 的发布、JustMicrock 对竞争格局的抱怨、OpenCode 的免费模型菜单,以及 OmniRoute 的回退层,都指向同一个需求:高端能力既能跨订阅携带,也能跨提供商策略续跑。

[+] 移动端监督表层 - VoiceClaw 说明,人们开始对“在手表或手机上审批、转向工作”产生需求,而不是一直守在原始机器前;但目前证据仍然只来自少量帖子。


8. 要点总结

  1. 今天最重要的模型故事,不只是性能,而是可检查性。 @Alibaba_Qwen 开放权重时间点、价格和基准测试主张绑在了一起,而 @codeglitch 则把这次发布转译成了带检查点的 DONE / NEXT / BLOCKED 工作流。
  2. Codex 正在被按运营工作流,而不只是按代码生成来评估。 最强证据来自 @gdb 推广的反馈到路线图技能、@gdb 强调的广告执行工作流,以及 @github 展示的 82 个已合并文档 PR 和 44.8 小时中位合并时间。
  3. 技能与运行框架打包,正在成为自己的竞争层。 @FlowAltDelete 运行框架选择当成架构决策,而 Skill RecorderAMD Skillsmimeographs,以及那条仓库汇总都把可复用的智能体行为当成了产品。
  4. 信任仍然落后于能力。 同一天里,既出现了 运行时控制平面的产品宣传被拦住的 Codex Security 扫描Antigravity 的数据丢失抱怨,也出现了 AISLE 的一键 RCE 披露
  5. AI 编程熟练度,正在同时渗入设备和岗位。 @BenjaminBadejo 智能体监督搬上了手表,而 @LeadHerLogic 分享了一则合同工岗位,把日常使用 AI 编程助手视为基础要求的一部分。