Twitter AI - 2026-10-05¶
1. 大家在讨论什么¶
1.1 开放权重竞争的评判标准,正在转向成本曲线、主权属性,以及谁真的能交付(🡕)¶
最强的一组讨论并不是某个单一基准的胜出,而是开放权重发布、平均售价下滑,以及明确打出“主权”定位这三者的叠加。至少有四条被保留的内容支撑了这一趋势:Dan Niles 将 token 支出压缩与开放权重定价联系起来;Seb Johnson 和 Arnaud Bertrand 围绕 Aleph Alpha 的 Kolibri-1 对欧洲 AI 意味着什么展开争论;而 Reflection AI 也从传闻阶段走向了具名发布 Beam,并给出了详细的算力叙事。
@DanielTNiles 辩称(366 次点赞,49 条回复,35,546 次浏览,126 次收藏)称,AI 基础设施仍然是少数值得继续精挑细选的领域之一,但更重要的细节是其背后的定价信号:从 2026-08-02 到 2026-09-27,Anthropic 加 OpenAI 的支出下降了 11%,而 token 量仍在上升;他明确将这表述为开放权重定价可能带来的影响。这条帖文之所以重要,是因为它把“模型商品化”从一种意识形态层面的争论,变成了运营者可以在支出数据中直接观察的现象。
@SebJohnsonUK 辩称(187 次点赞,28 条回复,34,485 次浏览,49 次收藏)称,Mistral 恰好在足够便宜的开源方案开始具备可行性之际,错失了主权 AI 的窗口期;与此同时,Aleph Alpha 的引述发布帖 将 Kolibri-1 定位为一款拥有 78B 参数、3.46B 活跃参数、1M 上下文窗口、Apache 2.0 权重并可本地部署的模型。@RnaudBertrand 补充说(74 次点赞,5 条回复,5,627 次浏览,9 次收藏)则给出了最尖锐的细节:Kolibri 虽然是在欧洲从零训练的,但仍大量借鉴了中国的开源论文和合成数据方法,这使“主权”AI 看起来更像是开放知识公域的衍生物,而不是封闭的国家技术栈。
@wallstengine 报道称(71 次点赞,9 条回复,15,504 次浏览,13 次收藏)称,Reflection AI 已发布 Beam,这是一款拥有 501B 参数、23B 活跃参数、1M 上下文窗口,以及 1 亿次强化学习 rollout 的开放权重混合专家模型,同时也指出其基准测试说法仍未得到验证。正是这种“基础设施细节非常具体、同时又明确附带保留意见”的组合,定义了当天开放权重讨论的整体氛围:比传闻更具体,但在独立评估出炉之前,仍不足以被完全信任。
讨论洞察: 回复不断把讨论拉回到“证据”上。Kolibri 的支持者很快就不得不回答,“在欧洲构建”究竟意味着“从零训练”,还是仅仅“基于中国已有成果做微调”;而 Beam 的支持者则仍需为未经验证的数据和极高的算力投入辩护。
与前一天的对比: 相比 2026-10-04 当天围绕开放权重的讨论更多停留在战略竞赛和支出论点层面,2026-10-05 的讨论已经转向具名产物、参数规模,以及支出数据中已经能够感受到的定价压力。
1.2 对基准测试的信任,已从榜单带来的兴奋转向部署约束、水印机制和专有数据主张(🡕)¶
下一组讨论聚焦于:一旦产品政策和评测设计介入,基准测试胜利究竟还有多大价值。Kairos 1 对“人类行为模拟”的宣称,以及 OpenAI 在欧盟推进水印的举措,都指向同一个根本张力:在把一张漂亮图表当作可操作的真实结论之前,社区依然希望看到公开、对抗性的验证。
@kevinbanghe 推出了(172 次点赞,95 条回复,6,235 次浏览,44 次收藏)将 Kairos 1 描述为一款旨在模拟个体人类行为、而非群体平均行为的模型,并称它在 13 项模拟基准上击败了 Persimmon、Astra、Fable 和 Gemini。后续回复补充了这一说法背后的核心证据:作者表示,已有超过 100,000 人向其专有训练集贡献了开放式个人故事和决策,而且公开的分数仍来自一个早期检查点,而非最终定型系统。

@testingcatalog 报道称(174 次点赞,18 条回复,16,594 次浏览,37 次收藏)称,OpenAI 将在未来几周开始在欧盟为 ChatGPT 和 Codex 文本加入水印,同时 API 水印仍保持为可选加入,并引用了 OpenAI 的内部说法,即 Astra 的基准表现没有出现有意义的下降。回复中立刻有人提出质疑:水印在代码差异(diff)中会如何表现?此外,即便开启水印后在 Terminal-Bench 上仅有小幅提升,也应接受公开测试,而不是被盲目照单全收。

讨论洞察: 两条帖文都招致了同一类怀疑,只是切入方向不同。Kairos 必须回应封闭数据和早期检查点的问题;OpenAI 则必须解释,一旦生成代码被重新格式化、重构,或与人工编辑合并,这种“不可见”水印到底意味着什么。
与前一天的对比: 在 2026-10-04,关于评测的讨论仍主要集中在更好的测试框架和裁判模型上;到了 2026-10-05,评测可信度的问题已经更贴近产品政策和专有训练数据本身。
1.3 物理 AI 的争论持续收敛到数据引擎、仿真资产和覆盖缺口,而不是更聪明的机器人“大脑”(🡕)¶
与开放权重或评测相比,物理 AI 仍是一个较小的讨论簇,但其叙事框架明显变得更锋利了。那些真正保留下来、仍被认为有信号的帖子,并不是在庆祝又一个机器人演示,而是在强调:稀缺资产是能够持续生成多样且经过验证经验的系统。@Captainmetax 辩称(124 个赞、146 条回复、347 次浏览)认为,Axis 真正的护城河不是机器人政策,而是一个基于浏览器的数据引擎:它收集轨迹、验证轨迹、将其送入训练流程,并从真实世界的失败中持续学习。这篇帖子里最具体的证据是规模:在线 hub 中有 222,000 名用户和 690 万条轨迹,并配有一套详细的模拟、验证、训练和真实世界反馈闭环。

@xtrabeee 补充说(32 个赞、22 条回复、259 次浏览)认为,Axis 与 Manycore Tech 的合作,本质上是为一个 3D 生成模型提供可用于物理仿真的模拟资产,这样模型学习的就不只是像素,而是有现实约束的环境。这也把讨论主题从“收集更多数据”扩展为“为具身空间智能收集正确的物理信号”。
讨论洞察: Axis 这条讨论下最有力的一条回复指出,积分活动其实是伪装成激励机制的行为经济学实验。这个观点很有价值,因为它把一个悬而未决的问题摆了出来:社区数据引擎或许可以扩张规模,但仍必须证明自己吸引来的是正确的覆盖,而不只是更多点击。
与前一天对比: 与 2026-10-04 相比,当时物理 AI 只是与翻译、语音和生物技术并列的几个垂直话题之一;到了 2026-10-05,数据引擎本身成了讨论的核心对象。
2. 什么让人沮丧¶
模型选择依然显得昂贵、间接,而且缺乏足够观测手段¶
严重程度:高。最明确的一类一线操作者挫败感在于,token 需求可能在上升、支出却在下降,但用户依然得不到一个干脆的答案:对于某个特定任务,哪个模型算是“足够好”。@DanielTNiles 显示(366 个赞、49 条回复、35,546 次浏览、126 次收藏)恰好说明了这种错位;而 Beam 和 Kolibri 的两篇帖子,都把发布质量变成了一个定价和部署问题,而不再只是纯粹的基准测试问题。眼下的变通办法是选择性路由加上人工怀疑。值得做:高。
基准测试宣称依然跑在独立验证前面¶
严重程度:高。@wallstengine 表示(71 个赞、9 条回复、15,504 次浏览、13 次收藏)指出,Beam 的性能宣称尚未经过独立验证。@kevinbanghe 表示(172 个赞、95 条回复、6,235 次浏览、44 次收藏)指出,Kairos 的分数来自一个基于专有数据集构建的早期 checkpoint。@testingcatalog 披露了(174 个赞、18 条回复、16,594 次浏览、37 次收藏)提到 OpenAI 关于水印“没有明显影响”的说法,而回复则立即从代码层面的具体理由提出质疑。当前的应对方式是公开怀疑,再等待第三方测试。值得做:高。
物理 AI 依然缺少足够经过验证的边缘案例数据¶
严重程度:中高。@Captainmetax 作出(124 个赞、146 条回复、347 次浏览)把抱怨说得很明确:更多数据还不够,除非这些数据覆盖了更难的任务、失败案例和分布偏移。@xtrabeee 呼应了(32 个赞、22 条回复、259 次浏览)指出,世界模型依然需要有现实约束、可用于物理仿真的环境,而不是静态图像。当前的变通办法是浏览器模拟加贡献者激励,但公开证据仍把这视为一个尚未解决的瓶颈。值得做:高。
3. 人们希望存在什么¶
同时结合质量、成本和部署约束的路由层¶
人们真正想要的,并不是又一则模型发布公告,而是一个能把基准可信度、部署策略和价格结合起来的界面。@DanielTNiles 追踪了 将 token 增长与支出压缩并置,@testingcatalog 强调了 合规侧的变化可能影响编码工作流,而 Beam 和 Kolibri 则让部署地点本身成为采购决策的一部分。现有的基准测试仪表盘只能部分满足这种需求。机会:直接。
足够便宜、跑得起来且足够透明、可审计的主权开放权重技术栈¶
围绕 Kolibri 和 Beam 的讨论表明,这是一种现实需求,而不只是出于“爱国”考量。团队想要的是具备长上下文、工具调用能力、可本地控制,并且能在自有硬件或基础设施上实际评估的模型。@SebJohnsonUK 将其表述为 抓住了这个市场窗口,而 @RnaudBertrand 坚持称 则强调要如实说明依赖链和借鉴的方法。机会:竞争性。
为物理 AI 提供覆盖范围、验证和反馈闭环可见性的数据引擎¶
Axis 的帖子本质上是在呼唤这样一个系统:它能说明现有哪些数据、覆盖了什么、如何验证,以及模型下一步还需要哪些新增经验。@Captainmetax 描述为 明确展示了这一闭环,而 @xtrabeee 描述为 则呈现了同一问题的资产侧。现有的遥操作和仿真工具覆盖了其中一部分,但这一需求看起来仍然十分迫切。机会:直接。
4. 在用工具与方法¶
| 工具 | 类别 | 情绪倾向 | 优势 | 局限 |
|---|---|---|---|---|
| Kolibri-1 | 开放权重基础模型 | (+/-) | 100 万上下文、每个 token 的活跃参数较低、Apache 2.0 权重,以及明确的本地部署主张 | 公开的性能说法仍需独立验证 |
| Beam | 开放权重代码/推理模型 | (+/-) | 大上下文、面向 agent/编码的定位,以及异常详细的算力披露 | 权重当时仍未发布,且基准测试说法也被明确标注为尚未验证 |
| Kairos 1 | 人类行为仿真模型 | (+/-) | 面向个体层面的决策仿真,而不是群体平均值 | 专有数据集和早期 checkpoint 评估使外部难以建立信任 |
| textGrain watermarking | 合规/溯源层 | (+/-) | 在不声称会带来基准性能损失的前提下,提供了一条满足 EU AI Act 合规要求的路径 | 该信号在真实编码工作流和编辑过程中的保留效果仍不清楚 |
| Axis Hub / Axis Suite | 物理 AI 数据引擎 | (+) | 将浏览器仿真、验证和真实世界反馈连接成一个训练闭环 | 公开证据仍主要集中在规模和叙事,而非误差拆解 |
| 面向物理的仿真资产 | 世界模型数据方法 | (+) | 为 3D 或空间系统提供有现实基础的环境,而不是扁平像素 | 资产管线成本高昂,而且仍只能覆盖真实世界的一部分 |
总体来看,大家对那些会暴露自身运行假设的方法持积极态度。Kolibri 和 Beam 之所以受到关注,是因为它们明确给出了上下文窗口、活跃参数数量和算力预算。Kairos 之所以受到关注,是因为它点明了底层数据集的核心假设,而不是只发一张排行榜。Axis 之所以受到关注,是因为它直接展示了采集与反馈闭环,而不是只声称“机器人更强了”。
最明显的应对方式,是分层怀疑。人们会先综合参数卡、部署说法、支出数据,以及回复串里的质疑,再决定是否把某项说法视为可靠。这也是为什么只展示一张基准测试截图的方法,会显得不如那些同时展示生产落地路径细节的方法有说服力。
5. 人们正在构建什么¶
| 项目 | 构建者 | 功能 | 解决的问题 | 技术栈 | 阶段 | 链接 |
|---|---|---|---|---|---|---|
| Kairos 1 | @kevinbanghe | 模拟个体人类行为,而不只是群体平均值 | 前沿模型往往会遗漏个人语境、历史以及决策差异 | 专有人类决策数据集、仿真基准、大规模偏好轨迹 | Alpha | 帖子 |
| Beam | Reflection AI,通过 @wallstengine | 面向编码、推理和 agent 工作负载的 501B 开放权重 MoE | 为企业和主权用户提供一个定位上可与中国领先模型竞争的开放模型 | 501B 总参数 / 23B 活跃参数、100 万上下文、在 GB300 集群上进行大规模 RL rollout | Alpha | 帖子 |
| Kolibri-1 | Aleph Alpha,通过 @SebJohnsonUK | 面向长上下文、具备工具调用能力、支持本地部署的欧洲开放权重模型 | 为工业和政府采购方提供主权部署选项 | 78B 参数、每个 token 3.46B 活跃参数、100 万上下文、Apache 2.0 权重 | 已发布 | 发布, 评论 |
| Axis 数据引擎 | @axisrobotics,通过 @Captainmetax | 在浏览器仿真中收集机器人轨迹,进行验证,并将其反馈回策略训练 | 物理 AI 团队需要更多样化、更结构化且能持续改进的训练数据 | 浏览器仿真、验证过滤器、真实世界反馈闭环、实时贡献者网络 | 已发布 | 帖子 |
Kairos 和 Axis 是最清晰的例子,说明一些团队正围绕他们认定的真正瓶颈来构建产品。@kevinbanghe 并未主打 推销的并不是一个更好的通用助手;他主推的是一套用于建模个体行为的数据集和基准测试方案。@Captainmetax 并未主打 更智能的机器人模型权重;他提出了一套循环机制,持续生成更好的机器人经验数据。
相比之下,Kolibri 和 Beam 展示了开放权重构建者模式分化出的两个方向。Kolibri 强调本地控制和主权部署,Beam 则强调规模、RL 算力和企业级开放性。两者都在试图解决同一个元问题:让先进模型能力足够可移植,使买方不必只信任前沿 API 供应商。
6. 新动态与值得关注的事¶
Beam 以具名发布和披露规模的方式,把美国开放权重讨论变成了一个明确的版本发布¶
@wallstengine 报道称 一个 5010 亿参数的 Reflection AI 模型、1 亿次 rollout,以及超过 70 亿美元的算力交易,同时仍指出缺乏独立验证。这之所以值得关注,是因为它把讨论从传闻推进到了一个具有可审计声明的实际产物。
水印从政策讨论走进了 ChatGPT 和 Codex 的产品行为¶
@testingcatalog 报道称 不可见文本水印即将进入欧盟地区的 ChatGPT 和 Codex,而 API 使用仍为可选加入。这很重要,因为它让合规成为日常代码输出行为中可见的一部分,而不再只是政策备忘录里的内容。
Axis 让“物理 AI 数据引擎”这一论点变得格外清晰¶
@Captainmetax 显示 它给出了一个比常见机器人模型宣传更完整的公开叙事:采集、验证、训练、反馈、用户数和轨迹数。这之所以值得关注,是因为它把一个抽象瓶颈变成了一个可见的运营闭环。
7. 机会在哪里¶
**[+++] 面向开放和闭源模型的独立路由与验证界面 ** - 来自 Dan Niles 支出分析、Kairos 专有基准声明、OpenAI 水印上线以及 Beam 未经验证发布的证据,都指向同一个缺口:团队仍然需要一个统一界面,把质量、成本、合规和信任整合起来。
**[++] 面向物理 AI 的数据引擎,能展示覆盖范围、验证情况和失败样本回收 ** - Axis 以及 Axis/Manycore 的合作都在说明,更好的模型权重是更好经验闭环的下游结果。这个机会看起来很强,因为痛点已经很明确,而当前公开解决方案仍主要集中在局部覆盖。
**[++] 主权型开放权重部署栈 ** - Kolibri 和 Beam 表明,市场对可在本地或国家控制下运行的大上下文开放模型有明确需求。这个机会属中等,因为已有严肃的入局者,但围绕它们的信任、工具链和评测层仍不成熟。
**[+] 面向生成文本与代码、具备政策感知能力的溯源工具 ** - 欧盟水印让溯源成为一个产品问题。这个信号还处于早期,但如今已越来越难把代码输出与其周围的合规规则分开来看。
8. 要点¶
- 如今,开放权重话语体系谈论的已不只是模型质量,也同样关乎定价和部署。 Dan Niles 的 token 与支出差距分析,以及 Kolibri/Beam 的帖子,都指向了这一点。(来源)
- 如果缺少运营层面的上下文,社区仍不会轻信一张看起来漂亮的基准表。 Kairos、Beam 和欧盟水印都立刻引来了要求进行对抗性测试或独立测试的呼声。(来源)
- 物理 AI 构建者的重心正转向数据引擎和仿真资产,而不只是更大的机器人模型。 Axis 和 Manycore 的合作让数据覆盖成为叙事核心。(来源)
- “主权 AI”正越来越多地被视为一个开源供应链问题。 在人们追溯 Kolibri 所依托的中国研究之后,它“欧洲打造”的说法显得更可信了,但也更复杂了。 (来源)