zhudong.si
中文EN
深度研究报告 · DEEP RESEARCH

SEEDByteDance Seed 深度研究报告

AI for AI、环境学习与系统智能

研究截止:2026-10-06章节:17全文:约 3.4 万字版本:V1.0

研究截止:2026 年 10 月 6 日
报告性质:独立专题研究;公开资料分析;版本 GPT V1.0
研究对象:ByteDance Seed,以及与其能力部署相关的字节跳动产品、研究与基础设施。

本报告从公开资料重新建立判断,不把产品名称、模型发布频率、平台流量或管理层愿景作为超级智能已经形成的证据。研究截止日是资料核验日期,并不表示每条来源都在该日发布。对动态文档,采用截止日可访问的内容;对论文,优先采用已核验版本。引用编号对应文末来源目录。

执行摘要

本报告判断:ByteDance Seed 最值得研究的地方,是它正在尝试把模型使用过程中产生的反馈,转化为下一轮模型与系统改进的输入。这个机制已经有若干工程实例和受限实验支持;它是否足以提高前沿智能的长期增长速度,目前仍不知道。

这家公司不宜只用“豆包用户多”“视频生成强”或“中国的大模型竞争者”解释。研究端存在几条相互关联、又不能混为一谈的路线:通用 Agent 的模型训练;运行中的环境学习;经验向权重的蒸馏;评测、数据和训练基础设施中的 AI 辅助研发;形式数学、生命科学与机器人中的专用验证闭环。它们共同指向一个更具体的问题:一次成功或失败,怎样成为系统下一次工作的能力,而不只是留在一次会话里? [2][6][8][9][18][24][51][52]

本报告形成七项核心判断,均属于研究综合判断 D,其事实基础和限制在正文展开。

  1. AI for AI 已有明确的官方研发使用披露。 Seed for Seed 涉及的工作超过代码补全。但公开材料尚不足以计算 AI 对整个研发周期、研究质量或下一代模型能力增量的净贡献。[2]
  2. 持续改进存在不同层次。 利用上下文反馈、更新任务记忆、训练专用策略、跨轮蒸馏经验、研发下一代通用模型,是不同的机制。把前四项合并称为“递归自我改进已发生”,会抹掉最重要的证据边界。[6][8][9][19][51][52]
  3. 经验保留是比“Agent 能运行多久”更有解释力的变量。 运行更久只有在反馈有效、错误可定位、经验可保留且收益可迁移时,才可能变成持久能力。持续在线和持续学习不能互相替代。
  4. Seed 的路线同时保留中心模型与系统组合两种可能。 原生 Agent 模型减少模块间的信息损失;Harness、工具、沙箱和验证器提供模型权重之外的能力。公开证据支持两者协同,尚不足以支持“超级智能一定首先是多 Agent 系统”。[11][13][36]
  5. 字节的应用与基础设施可以降低研究部署之间的摩擦,但无法自动产生优质训练数据。 流量包含大量冗余、弱反馈、商业目标和权限限制;客户数据还受到产品条款与授权约束。需要研究的是有效反馈产出,而非总 Token 数。
  6. 物理智能有实质进步,也有清晰的任务范围。 真实机器人强化学习比视频演示更接近有效证据,但任务专用策略的收益不能直接外推到通用家庭机器人。Digital 与 Physical 的进展应分别监测。[20][21][22][23][24]
  7. 最可能先出现的优势是可验证工作流的规模化,而非一个明确的 AGI 发布日。 一旦验证吞吐、经验迁移与研发周期同时改善,才有理由上调 AI R&D Takeoff 情景;单项榜单、模型参数传闻或投资计划都不够。

报告采用一个分析框架:反馈质量 × 经验保留 × 跨任务迁移 × 实验吞吐 × 可控资源调用。这是用于追踪因果关系的框架,不是经过拟合的能力公式,也不对各因子赋予伪精确权重。任何一个环节接近失效,其他环节的规模扩张都可能只制造更多低质量尝试。

一、研究问题、证据纪律与对象边界

1.1 六个真正需要回答的问题

本次研究没有先按产品划分章节,而是先提出六个需要证伪的问题。

研究问题 支持该机制需要看到什么 什么会削弱它
AI 是否已进入 AI 研发闭环? 有真实任务、实验反馈、被采用结果及研发阶段记录 仅演示代码生成;采用率和周期贡献未知
环境中的改进能否保留下来? 清空上下文后仍有收益;更新权重或持久状态的可重复结果 只是在同一任务中反复尝试;离开反馈环境即失效
保留的经验能否迁移? 新仓库、新任务、新工具及新分布上的提升 同题记忆或评测过拟合;跨任务退化
应用规模能否提高智能增长速度? 有效失败数据、清晰奖励、可用授权和回流链路 Token 增长主要来自免费补贴、长输出、重复请求
模型和系统谁决定上限? 固定预算的架构比较与模块消融 更多 Agent 只扩大花费或相关错误
工业资源与控制能否跟上? 已交付算力、可用环境、验证能力和权限边界同步扩张 资本承诺无法变成可用实验资源;监督成为瓶颈

这些问题不要求先认定 Seed 的路线正确。相同事实可能有两种解释:它可能是智能增长反馈机制的早期工程化,也可能主要是一套更高效的产品与研究组织。报告保留这两种解释,并追踪能够区分它们的指标。

1.2 证据等级不是可信度的一维排名

等级 本报告含义 使用纪律
A 独立研究、第三方测量、权威统计;标明预印本或其他限制 独立不等于无误,也不等于直接测过 Seed
B 公司一手披露、官方仓库、由公司参与的技术论文 证明公开路线与自报实验;自报能力仍需复现
C Reuters、FT 等媒体,以及有来源的新闻报道 匿名消息、转述与官方否认分别标明
D 本报告的分析、机制模型、情景及建议 不能伪装成实验结果或内部事实

特别处理三种容易混淆的情况:

1.3 Seed 不等于整个字节,也不等于豆包 App

Seed 官方将团队起点写为 2023 年,研究覆盖通用智能相关方向。截止日官网列示 Seed2.1、Seedance 2.5、Seedream 5.0 Pro、SeedRealtime、Seed Audio 1.0 与 Seed GR-RL 等不同模型或研究框架。[1]

本报告区分五个层级:

层级 研究对象 不应直接推导的结论
研究团队 Seed、Seed Edge 与联合研究项目 不等于所有字节 AI 研发均由同一组织负责
模型 Seed 通用系列、TARS、Prover、生成与具身模型 不等于所有模型已整合进同一个权重系统
运行系统 Harness、工具、沙箱、记忆、验证与调度 不等于基础模型自身已获得这些功能
产品与渠道 豆包、扣子、TRAE、火山方舟、BytePlus 等 产品发布不等于某一模型的独立能力提升
公司资源 采购、融资、云基础设施、商业化渠道 公司总预算不等于 Seed 的训练预算

同一公司可以有共享基础设施,也可以有独立业务目标。将每个产品、论文和采购消息都拼成一个统一的“超级智能架构”,会制造不存在的组织确定性。

1.4 当前资料的缺口

截至截止日,本报告未获得 Seed 全部研发阶段的 AI 使用占比、统一的人类介入定义、跨代研发周期的可比序列、完整集群清单或由独立机构验证的持续前沿研发反馈数据。

这限制了结论强度,但不使已披露的局部工作失去意义。研究任务是识别哪些因果链已经有证据,哪些只是可能连接,而不是用“未披露”填零,也不是用公司规模填补未知。

二、Seed for Seed:从研发工具到智能增长反馈,跨过了哪几步

2.1 官方披露已经超过 coding assistant

2026 年 6 月 23 日的 Seed2.1 发布说明明确描述 Seed for Seed:模型进入评测、数据、训练、研究与 Infra 环节,任务包括评测系统开发、能力诊断、SFT 数据合成、RL 框架优化,以及通过代码和实验实现、验证研究论文方法。官方还描述了依据中间结果反复诊断、修改、验证,复杂任务可由不同角色的 Agent 协作。[2]

证据结论:存在官方披露的 AI→AI 研发工作流。 这比“模型能写 Python”更强。限制:这一披露没有提供足以独立估计整个研发管线净加速的对照数据。

尤其不能把官方所说任务可跨越小时、数十小时乃至数十天,转换成“模型具有数十天的无干预人类任务 Horizon”。跨度可能包含实验等待、阶段性人类决策、多个 Agent 或工程系统维持,测量口径并未统一。[2][34]

2.2 研发闭环分为六层

以下是本报告提出的分层方法 D,编号只表示证据要求递进,不表示公司已经逐层通过。

层次 改进的对象 最低证据要求 Seed 当前公开材料的状态
R0 工具辅助 人的代码、文档、检索 任务效率或成果质量 已有产品和研究使用披露
R1 工作流闭环 具体研发任务 实验→诊断→修改→再实验 Seed for Seed 官方披露支持 B
R2 可保留的任务学习 记忆、策略、模型参数 离开原上下文仍有收益 专用研究提供 B 级实验支持
R3 研发方法改进 算法、训练流程、验证系统 AI 提案通过隔离评估并进入实际研发 个别工作类型被披露;总贡献未量化
R4 跨代研发反馈 下一代前沿模型及其研发系统 多代可比因果数据、迁移收益、周期缩短 公开证据不足
R5 研发起飞 智能增长的长期速度 加速具有持续性,且不是资源投入解释 不能认定已发生

R2 可以通过人类设计的循环实现。系统每轮变强,不代表它设计了下一轮学习算法,也不代表所有关键研发决策已经由 AI 承担。局部反复改进、研发自动化、递归改进和研发起飞应分别命名。

2.3 评测、数据与训练框架为何是先进入的环节

本报告判断 D:这些环节有三个适合自动化的性质。

第一,结果更容易转化成可执行工件。测试脚本、数据处理程序、日志诊断、训练配置和性能测试都有相对明确的输入输出。第二,反馈速度通常比新范式研究更快。代码能否运行、吞吐是否改善、故障是否复现,可以较快测量。第三,许多任务可拆分且成本较低,允许并行尝试。

但“容易产生工件”不等于“容易判断正确”。模型可以写出逻辑一致但偏差严重的评测;可以合成大量满足格式但缺少新知识的数据;可以把训练吞吐提高,却降低最终质量或稳定性。

因此,AI for AI 的第一道关键门槛是独立于生成者的评估。评价同一个优化提案,至少需要区分代码运行、训练稳定、预算可比、目标能力改善及其他能力没有明显退化。只通过第一项,会把研发自动化降格为自动生成工作量。

2.4 研发提速的正确分母

研究周期并不只是研究员敲代码的时间。以下分解是分析模型 D:

[ T_{\text{研发}}=T_{\text{问题定义}}+T_{\text{实现}}+T_{\text{排队与实验}}+T_{\text{验证}}+T_{\text{整合与决策}} ]

各项可以部分重叠,公式不用于机械相加估算公司周期。它提醒我们:实现环节很快之后,实验排队、误报审查和发布决策可能成为新的瓶颈。

举例,纯属敏感性演示: 若一个管线有 40% 的可加速工作得到五倍提速,其余环节固定,整体加速上限约为 (1/(0.6+0.4/5)=1.47) 倍。这个数不是 Seed 数据。它说明“编码效率提高五倍”与“模型迭代五倍快”之间存在很大的因果缺口。

也不能只数实验数量。若 Agent 让一天的实验从 20 次增加到 200 次,却没有提高通过严格验证的有价值发现数量,研究系统可能更加拥堵。

更合适的分母是:同等质量、同等总预算条件下,每个被复现并采用的改进需要多少人时、机器时和日历时间。研发起飞要求这些指标共同变化,而不是单项数量膨胀。

2.5 能证明跨代正反馈的证据应长什么样

独立研究提供了一个可借鉴的起点:METR 的 RE-Bench 将人类专家与模型 Agent 放入相同研究工程环境,提供相同资源与信息,再比较不同时间预算下的成果。其 2024 年实验中,短预算与长预算的相对表现不同;研究者同时提醒,真实研发目标更模糊、反馈周期更长。[35] 本报告不把这些旧模型结果当作当前 Seed 的能力结论,而采用其方法纪律:同环境、同资源、人类对照、预算曲线与完整轨迹。

本报告建议用三代或更多模型与研发系统组成的审计序列进行检验 D。三代是提高判别力的研究设计建议,并非 ASI 的定义门槛。

每代固定记录:AI 获得的权限与预算、承担任务的阶段、建议被接受与拒绝的原因、独立复现实验、被实际合入的改进、对下一代研发任务的收益,以及人类新增验证成本。

关键对照是“人类加工具”“固定版本 Agent”“更新版本 Agent”,而不是 AI 使用前后的简单比较。后者会受到团队扩张、更多芯片、不同任务难度、模型配方改变和组织成熟的影响。

真正强的证据是:新一代系统在相同资源下更善于改进研发方法,其成果帮助下一代获得更高研发能力;这个收益能超出原评测分布,并持续抵消验证与实验的新增成本。

当前判断:Seed for Seed 已把研发反馈作为工程方向,但从“帮助研究人员做更多事情”到“持续提高智能增长速度”的公司级转变,仍缺少公开的因果测量。

三、最关键的技术线索:经验怎样从一次任务进入下一次能力

3.1 不同的“学习”不能合并统计

机制 改变什么 经验如何保留 主要失效方式
上下文内反馈学习 当前推理条件与后续行动 保留轨迹、观察与反馈 清空上下文后收益消失;压缩丢失关键状态
持久记忆 外部可读取状态 文件、索引、摘要、任务记录 错误记忆、检索失败、跨租户泄露
小型适配器学习 局部可训练参数 参数更新 任务偏置、漂移、遗忘
经验蒸馏 学生模型权重 将有经验条件的决策转为训练信号 记住旧任务、经验缺陷被固化、迁移不足
专用强化学习 策略及相关评估组件 权重与训练管线 奖励投机、分布偏移、局部最优
AI 研发方法创新 改进下一代模型的过程 算法、训练系统、研发知识 研究价值无法验证或无法迁移

只有最后一种直接涉及改进“制造智能的方法”;前五种可以提供材料和能力,但连接需要实验验证。本报告不把任何一种排除在超级智能形成机制之外,也不把它们统称为同一件事。

3.2 EdgeBench:重要的新测量,不是 ASI 时钟

EdgeBench 的公开研究覆盖 134 项跨领域任务、约 38,000 小时交互,开放 51 项任务及评测框架;任务允许至少 12 小时运行。作者报告聚合表现随交互时间呈 log-sigmoid 形态,平均拟合 (R^2=0.998)。模型代际学习速度趋势来自一个初始能力相近的 18 任务子集,报告约三个月翻倍。[6][7]

论文明确将主要学习机制解释为上下文学习:Agent 保留观察、诊断和既往尝试,改善下一步决策。它没有通过这些交互直接训练被评测模型的基础权重。[6]

本报告判断 D:这项研究的价值,是把“给 AI 更多时间”拆成有反馈的搜索与经验积累。 过去只看最终分数,可能错过模型学习速度的差异;只看尝试次数,又可能把随机搜索当作学习。

但需要防止五种误读:

  1. 聚合曲线平滑不代表每个任务都平滑。 真实任务的迟滞、突破和停滞可能被平均掩盖。
  2. 拟合精度不等于十年预测精度。 在已有任务和时间范围内解释良好,不能证明新环境、更多预算或更强模型仍遵守同一规律。
  3. 学习速度翻倍不等于研发速度翻倍。 两者的任务分布、预算与结果单位不同。
  4. 开放子集不等于完整复现。 独立团队还需要访问同等工具、运行协议与反馈,才能判断广泛性。
  5. 得到任务分数不等于现实组织交付。 客户验收、责任承担、权限冲突和未形式化需求,会改变问题性质。

论文自身讨论强瓶颈、异质任务结构与时间机制可能破坏规律。[6] 因此本报告把它作为新 Scaling 假设 B,而不将其提升为普遍自然定律。

3.3 Chain-of-Experience:更多推理的价值取决于反馈,而非字数

2026 年 8 月的 Chain-of-Experience 研究,将既往尝试与自我或环境反馈保留在推理上下文,考察数学、代码和知识任务。作者报告不同反馈机制的收益与成本差异,并指出较多收益出现在早期迭代。[51]

这里改善的是推理过程,不是基础权重的持续更新。它的重要启示 D 是:推理预算应分配给产生新证据的行动,而非仅让模型写更长的理由。

例如,代码失败信息提供了新约束;另一个模型重复说“请仔细检查”可能几乎没有信息增量。一个判断错误的自评器,会把额外推理导向更自信的错误。反馈的价值取决于它能否区分候选方案,而非是否来自“另一个 Agent”。

在企业任务中,保存原始失败证据、可重放轨迹和数据版本,可能比保存一段漂亮总结更有价值。摘要压缩降低成本,却可能删掉真正影响下一次决策的边界条件。究竟保留多少,应通过下游成功率与复查成本测量。

3.4 Experience Distillation:出现了可跨轮保留的受限实验

2026 年 7 月的联合研究 Sample-Efficient Learning from Agent Experience,提出将试错上下文中获得的决策优势蒸馏进模型权重。研究包含软件工程任务与文字冒险环境,并有清空前轮经验、从更新后的权重开启下一轮的实验。[52]

值得记录的是三个不同结果,而非只看最亮眼的相对增幅:

实验问题 作者报告的结果 B 证据能支持什么
上下文收益能否进入权重? 蒸馏保留至少 64.8% 的 ICL 增益;直接 SFT 对照仅保留 3.8% 在所测分布中,经验处理方式影响保留效果
能否迁移到未参与经验收集的 SWE 任务? 494 项 OOD 任务的 pass@1 从 4.62% 到 8.84% 有迁移,但绝对成功率仍低
多轮收益能否积累? 六个文字冒险任务五轮后平均归一化分数从 7.1 到 47.0 受限环境中出现清空上下文后的跨轮积累

这些结果比“固定模型在同一道题上重试”强。它们也比宣称通用递归自我改进弱。实验管线由研究人员设计,任务集合有限;文字冒险中的连续轮次不等于前沿基础模型的多代研发,更不等于模型自主改写了自己的学习算法。[52]

本报告对这一证据的判断 D:已经可以认真研究可持续的局部经验闭环;仍不能认定前沿 AI R&D Takeoff。 若把“完全没有持续改进证据”作为立场,会忽视这类实验;若把它当成 ASI 已启动,也会超出证据。

下一步最有区分力的检验是:清空旧经验后跨任务能力是否保留;新领域是否受益;五轮之后边际收益是否继续;训练与教师生成成本是否被计算;旧能力和安全约束是否退化。

经验蒸馏可能有两种长期结果。乐观解释是,每一次高质量交互成为更好的通用策略;保守解释是,每一轮主要固化局部任务知识,收益最终随着任务集合耗尽而饱和。两种解释都与当前受限实验相容。

3.5 TaskMem:记忆不是越多越好

TaskMem 将“记住什么”建模为可学习策略,而非固定摘要。论文在流式视频问答设置中,先训练记忆质量,再利用近期任务反馈更新一个小型适配器;其主干模型保持冻结。论文的任务迁移消融显示,学习到的记忆关注并不自动转移到所有问题类型。[8]

这对持久 Agent 有两个直接启示 D。

首先,用户记忆、研发记忆和组织记忆需要不同的保留规则。研究 Agent 应优先保存失败原因、实验条件和反证;销售 Agent 应保存客户授权、真实需求与关系状态;生活助手则需要明确哪些个人信息应遗忘。

其次,系统可能越使用越熟悉某类需求,同时越不适合另一类任务。这种专门化是价值来源,也是偏置来源。不能用“越用越懂你”推导“越用越具有一般智能”。

因此,季度仪表盘必须分别记录记忆命中、事实准确、任务相关、过期清理与跨任务退化。若只数记忆条目或存储大小,无法判断能力是否增长。

3.6 Agent-R 与 CTRL:错误恢复需要专门学习

Agent-R 使用迭代自训练构造错误恢复轨迹,让模型学习及时修正而非等到任务结束;其实验范围是若干交互环境。[9] CTRL 则训练批评模型,使反馈对固定生成模型的代码纠错更有效。[10]

两项工作的共同研究意义 D 是:生成正确答案和判断如何纠错,是不同能力。一个看似高质量的 critic 可以准确指出错误,却给不出有用修复;也可以改善当前生成者,却对更强或不同风格的生成者无效。

研发 Agent 因此至少需要四种错误分类:信息不足、行动执行失败、目标误解和验证器不可靠。错误分类错了,增加重试会放大故障。例如,权限拒绝不是模型“不够努力”,外部工具反馈冲突也不能用更长思考替代实测。

持续改进机制的核心资产,可能是经过审查的错误数据和可复现验证环境,而不是 Agent 的对话数量。

四、Scaling 已分成多种资源,不能用一个开关解释

4.1 Seed 的证据指向多种扩张方式

2020 年常见的 Scaling 讨论围绕预训练模型规模、数据和训练计算。今天这一部分仍然重要,但 Seed 的公开研究同时涉及交互时间、强化学习、记忆、验证器、沙箱、工具与分布式系统。[3][6][8][11][14][15][16][17]

下表是本报告的机制分解 D,不表示各项已在 Seed2.1 中完成统一部署。

Scaling 类型 真正增加的资源 需要观察的收益 不能忽视的代价
Pre-training 参数、独特数据、训练 FLOPs 广泛基础能力与学习能力 数据质量、通信、硬件与长期训练稳定性
Post-training / RL 高质量奖励与训练交互 可靠行动、纠错和策略改善 奖励投机、偏置、回归
Inference-time 思考、候选与反馈回合 相同预算下的质量或可靠性 边际收益递减、延迟、重复推理
Context 可用任务状态 保留长依赖和失败历史 注意力成本、压缩损失、错误累积
Search / Verifier 候选覆盖与判断能力 更多真正被验证的解 验证成本、规格错误、搜索过拟合
Synthetic data 经验证的训练样本 有效经验与能力迁移 同质化、污染、错误固化
Agent runtime 交互时间和环境 得到初始推理没有的信息 等待、接口变化、权限和状态漂移
Parallel agents 并行探索与分工 独立且互补的候选 相关错误、协作成本、验证拥堵
Tool scaling 可调用资源与环境 新任务类型与真实行动 工具不稳定、授权、不可逆后果
Compute systems 有效计算吞吐 更快的训练、实验和部署 HBM、网络、CPU、功率、调度

其中最容易误读的是“加更多 Agent”:它增加的是计算与组织结构,不保证增加独立知识。另一种常见误读是“更长 Context”:它允许装入更多状态,但不能确保模型正确使用全部状态。

4.2 verl 与 DAPO:算法和工程必须一起看

verl 官方仓库说明它由 ByteDance Seed 发起、由社区维护,提供灵活的 RL 后训练框架。[14] DAPO 论文开放算法、训练代码和数据处理,强调大规模推理 RL 的若干稳定训练技术;其自报核心实验使用 Qwen2.5-32B 基础模型。[15]

两者支持的是字节参与可复用 RL 工具与方法建设,不是“Seed 所有能力都来自自研基础模型”,也不是“社区项目当前全部成果都应归于字节”。开源框架的贡献具有多方参与和跨模型特征。

本报告判断 D:可复现训练配方具有双重效果。一方面,它降低后训练尝试成本,加快整个生态的实验;另一方面,它让单一算法领先更容易扩散,公司的长期优势需要来自持续发现、工程效率、环境数据和部署反馈。

对 AI for AI,RL 框架还承担“让实验能被准确执行”的功能。模型提出一个奖励或采样改动,框架需要把它变成预算可比的实验;否则自动化只增加不可解释的变量组合。

4.3 预训练并未被 Agent 取代

官方训练数据摘要披露,Seed2.0 Pro 的预训练文本超过 10 万亿 Token、图像超过 10 亿张。这是训练数据规模披露,不是模型参数量。[46]

本报告判断 D:基础能力与环境学习可能互补。 基础模型越能读懂新反馈、提出合理候选,交互可能越有效;环境经验又可暴露预训练数据无法覆盖的工具、私有状态和实际故障。

但不能因此认定每项资源都应无限扩张。大模型可能提高单位交互收益,同时使每次交互更昂贵;小模型加更好的反馈,可能在受限流程中取得更好的成本效果。选择需要比较质量—成本—时延—介入率,而非单一排行榜。

4.4 “新 Scaling Law”需要四类复现

本报告建议 D:对环境学习的 Scaling 至少要求时间外推、任务外推、模型外推与预算外推。只在同一任务中增加时长,无法证明陌生任务也受益;按运行小时对齐,也不代表 Token、工具调用和硬件预算相同。

还应比较两种机会成本:同一个 Agent 多工作十小时,与十个独立候选各工作一小时。前者积累状态,后者扩大探索;哪种更优取决于反馈是否稀缺、任务是否有串行依赖以及经验能否共享。

更长期的 Scaling 上限可能由“发现并验证新经验的速度”决定。旧题、旧反馈与旧工具都被利用之后,新增时间的收益会下降。系统要继续增长,需要进入新的问题空间,并验证其中获得的经验。

这也是为何本报告把有效实验与验证器吞吐放在算力旁边监测。它们不只是部署附件,可能决定计算能否成为能力。

五、从原生 Agent 到复杂系统:中心模型仍然重要

5.1 UI-TARS 是连接模型训练与行动环境的一条实证路线

UI-TARS-2 技术报告描述了原生 GUI Agent 的训练方法,包括数据生成循环、稳定多轮 RL、结合 GUI 与文件系统及终端的环境,以及用于大规模 rollout 的统一沙箱。官方仓库将其发布日期列为 2025 年 9 月 4 日。[11][12]

Seed1.8 的模型卡则强调将搜索、代码执行和 GUI 交互能力纳入通用 Agent 模型,并关注成本和时延条件下的推理控制。[4]

这些研究支持一个重要判断 D:Computer Use 的进步不只是“识别屏幕上的按钮”,还取决于行动后的状态、错误恢复和多轮训练。 静态定位正确,不能保证下一步决策正确;下一步动作成功,也不能保证最后交付正确。

需要区分四个观测量:元素定位、单步操作、完整任务成功、真实流程交付。它们具有不同分母。例如,把表单填好是任务过程;是否写入正确客户记录、是否重复提交、是否保留审计证据,才决定交付是否完成。

5.2 三种竞争解释

假设 形成能力的主要来源 支持线索 最强反证方式
H1 中心模型主导 更强模型把感知、推理与行动统一起来 原生 Agent 训练、跨能力整合 固定模型的系统改进产生更大且广泛的收益
H2 运行系统主导 工具、状态、环境、验证与调度提供关键能力 Harness 与多环境执行;有反馈的长任务学习 更强单模型在简单系统中持续超越复杂组合
H3 联合进化 模型学会使用更复杂系统,系统为模型提供可学习经验 UI-TARS、环境学习、经验蒸馏的互补性 增加连接后成本失控,经验不能迁移

当前本报告采用 H3 作为工作解释 D,置信度中等。 这不是“系统一定先成为 ASI”的结论,而是它能同时解释模型训练与运行工程的公开进展。若未来出现单模型在简单运行环境中大幅超越其他系统,应调整判断。

中心模型和系统不是互斥实体。即使感知、记忆与行动大部分进入一个模型,它仍需要外部输入、资源授权、环境执行与结果验证。反过来,复杂系统无法通过编排把一个始终误解目标的模型无限放大。

5.3 DeerFlow:可以看到系统形态,不能据此看到系统超级智能

DeerFlow 当前官方仓库定位为长任务 Agent Harness,组合子 Agent、记忆、沙箱与可扩展技能,并支持不同模型。它属于字节公开工程生态,不能未经组织披露就认定为 Seed 内部研发系统的完整开源副本。[13]

本报告判断 D:Harness 的价值在于让任务能够延续、隔离、恢复与检查。例如,沙箱保留文件和实验状态,任务管理防止遗漏,轨迹回放帮助定位故障,记忆减少重复工作。

这些改进会提高“系统可工作性”,但能否超越大型人类组织,还需要三个更难的能力:选择值得研究的问题;判断多个结果之间的矛盾;在目标、预算与现实利益冲突时形成可问责的决策。

研究报告、代码、图像和视频都能被生成,不代表它们属于一套协调良好的组织产出。真正的组织能力是这些工件共享正确状态,并能通过外部验收。

5.4 多 Agent 是否必要:应按任务结构回答

外部研究 Towards a Science of Scaling Agent Systems 的 2026 年 4 月修订版,评估 260 种配置与六类基准,强调任务结构和协作架构的匹配;在可拆分金融任务中出现改善,在串行规划任务中则出现明显退化。报告采用修订版,不沿用较早博客的 180 配置口径。[36]

这一证据不能证明 Seed 的特定产品效果,但足以反驳“Agent 更多自然更聪明”的一般假设。

本报告判断 D:多 Agent 至少有四种不同价值:并行探索、能力专业化、独立验证和权限隔离。前三者可能提高质量,第四者主要改善控制。它们不应被统一成“群体智能分数”。

任务性质 候选组织方式 D 首要测量
独立资料收集、独立参数试验 并行子任务、集中汇总 结果互补性与去重后的有效发现
同一代码状态上的连续修改 少量执行者、明确状态所有者 冲突、返工、集成失败
多方案竞争且可便宜验证 多候选加独立验证 每单位预算通过验证的成果
单一任务包含不同权限 分权角色与受控交接 越权、状态泄露、审计完整度
目标模糊且验收依赖客户 人类目标负责人加 Agent 需求澄清成本与最终验收

一个需要反复理解同一状态的任务,拆成过多 Agent 可能降低效率。多个同源模型又可能共同遗漏同一个假设,投票无法修复相关错误。

因此,验证多 Agent 必须固定总计算预算、工具权限和验收标准,并与单 Agent 加更多计算比较。否则“协作提高分数”可能只是资源投入提高分数。

5.5 系统超过组织需要怎样的现实证据

本报告提出一个结果导向定义 D:在多个重要、开放、长期任务中,系统以可接受成本,稳定产出高于优秀人类组织的结果,并能处理失败、冲突与责任边界,才有理由讨论组织层面的超人能力。

应观察的是产品从需求到可靠部署的周期、科研从假设到独立复现的周期、优化从提案到运营收益的周期,而非创建了多少数字员工。

下图展示本报告的假设机制。虚线表示目前尚不能由公开资料证明已形成广泛、稳定的前沿反馈;它不是字节官方架构图。

flowchart TD
    M[基础模型] --> A[Agent 与运行环境]
    A --> E[实验与真实任务]
    E --> V[独立验证与失败诊断]
    V --> C[筛选后的经验]
    C --> K[记忆与局部策略]
    K --> A
    C --> T[训练与经验蒸馏]
    T --> M
    V -.-> R[AI 研发方法改进]
    R -.-> T

六、科研自动化:验证容易的领域可能先获得超人优势

6.1 形式数学提供清晰反馈,也提供清晰边界

BFS-Prover 的研究描述模型生成、Lean 环境执行、反馈、训练数据和模型优化的专家迭代循环。[19] Seed-Prover 1.5 则结合 Agentic RL 与测试时推理;作者报告了 PutnamBench、Fate 等评测和 2025 Putnam 题目的形式证明结果。[18]

本报告只把它们当作形式数学的专用系统证据。Lean 能检查形式证明是否在给定公理和陈述下成立,不能自动证明题目翻译忠实、假设合理、研究问题重要,或所有竞赛条件都与人类相同。

本报告判断 D:科学工作中“容易验证的困难问题”,可能比社会工作中“难以定义成功的普通问题”更早被自动化。 数学证明很难生成,但形式正确性可以严格检查;商业谈判的文字更容易生成,但长期关系、真实意图与损益分配难以形式化。

专用超人能力可以成为通用系统的重要模块,也可以长期停留在专用领域。不能只因为数学水平高,就推断其管理组织、识别新科学方向或处理现实伦理冲突的能力同样高。

6.2 Protenix-v2:从计算结果到实验命中的距离

Protenix-v2 公开研究包含生物分子结构预测及设计,报告了特定靶点、预算和实验活动下的命中结果,而不只是一个结构预测榜单。[26]

这比仅输出分子设计图更接近科研闭环,但有必要保留证据分层:结构合理、实验结合、功能有效、可开发性、动物实验及临床疗效不是同一终点。报告不把前端命中率外推成药物成功率,也不把有限靶点集合上的结果当作普遍生物智能。

本报告判断 D:科研自动化的下一瓶颈往往是实验容量与反馈延迟。假设生成速度可以迅速增长,实验样本、检测设备、培养周期及独立复现不会按同一速率增长。

一个更强的模型可能生成更少却更值得实验的候选;一个更大 Agent 团队也可能把实验室淹没在相似候选中。有效科研系统应优化“每个实验预算带来的新知识”,而非“每天提出多少假设”。

6.3 Seed STEM 与 Seed Edge:组织设计是变量,不是能力证明

Seed Edge 官方描述长期研究、跨模态合作、专项算力和较长评价周期,并明确列出记忆、在线学习、软硬件协同与 Agent 等研究主题。[5] Seed STEM 项目面向 100 位研究者发出合作邀请,首期预计约六个月;它是招募与合作计划,不是“已经有 100 位科学家加入”或“已经完成 100 项发现”。[27]

本报告判断 D:这两种组织设计试图降低短期产品指标与长期研究之间的张力。它们可能帮助发现新问题、建立专家反馈,尤其适用于现有网页数据无法提供的科学判断。

但长评价周期既可能保护探索,也可能推迟发现低效研究。足够计算资源既可能扩大实验,也可能弱化预算纪律。应追踪的是可复现成果、专家参与形成的高质量问题与评测,以及成果进入其他研发流程后的贡献。

公开组织意图不能替代公开研究效果。关于内部团队分工、实际人数、奖励制度实施效果,本报告不以招聘文案补全。

6.4 科学“原创性”仍是需要独立检验的问题

AI Research Agents Narrow Scientific Exploration 的 2026 年 7 月修订版研究五类框架与五个模型,生成 219,655 个研究想法,发现它们在所测科学空间中更集中、更接近起始文献,较擅长局部延伸。[37] 本报告使用修订版口径,未沿用较早摘要的样本数。

这不是对 Seed for Seed 的直接审计。它研究的想法分布、历史引用与科学影响代理,也不等于真实实验结果。但它提出一个严肃的竞争解释:研究效率提高,可能主要加快已有路线,而没有同等提高问题选择和原创发现。

本报告判断 D:持续学习最容易先发生在明确目标内。AGI/ASI 的更强主张还需要解释系统怎样选择目标、否定既有路线、找到新的抽象,并让这些发现通过现实检验。

“产生人类从未写过的文字”不能定义原创科学;“首次给出被独立验证的新知识”更接近有效标准。新知识仍需说明重要性、适用范围与可复现性。

七、World Model 与 Robotics:最需要抵抗演示外推的领域

7.1 视频、世界状态与行动策略是不同对象

截至截止日,Seedance 2.5 属于官方列示的视频创作模型;Seed3D 2.0 提供更接近仿真的三维资产、场景与可关节化内容;VideoWorld 研究从未标注视频中学习任务知识。[1][20][22]

本报告区分三种用途 D:

用途 优化目标 验证问题
内容生成 美感、可控性、连贯性 用户是否满意,编辑是否可用
世界预测 状态转移与反事实准确性 改变动作或初始条件后是否仍预测正确
行动学习与规划 任务结果、安全和成本 使用预测选择行动后,真实成功率是否提高

一个模型可以在第一项十分成功,而第二、第三项仍有限。创作模型合理补全场景,在娱乐产品中是优势;在物理预测中,合理但错误的补全可能成为事故源。

因此,视频视觉质量应与物理预测分开验收。应给出看不见的质量、摩擦、速度、载荷等变量变化,检查模型是否识别不确定性,是否在陌生条件中保持因果一致。

SeedRealtime 的 2026 年 8 月官方说明提供了另一条路线:端到端音视频全双工交互,处理连续观察、说话时机与自然打断。[25] 这与生成离线视频不同,也尚不是物理世界模型的证明。本报告判断 D:实时感知可能缩短观察与行动之间的反馈延迟,让助手在现场工作时获得更多状态;但观察连续不代表因果理解正确,主动回应也不代表已经获得执行现实行动的授权。其长期价值应由持续交互的任务结果、错过事件与隐私边界来验证,而非只看精选对话演示。

7.2 Seed 自己的研究也反对“视频 Scaling 自动学会物理”

How Far is Video Generation from World Model 在可控二维物理环境研究分布内、组合与分布外泛化,报告模型在所测分布外条件中无法可靠抽象普遍物理规律。[21]

这项较早研究不能证明最新 Seedance 必然有同样缺陷,也不能证明所有未来视频模型都失败。它提供的是反证方法:让条件变化可控,评估预测是否服从真实规律,而不是让人类评价画面是否“看起来符合常识”。

本报告判断 D:验证 World Model 的最强证据,应是动作条件下的反事实预测与现实规划收益。跨越这个门槛需要独立任务,不应由创作示例、精选剪辑或模型自评替代。

7.3 VideoWorld 与 Seed3D 解决的是不同环节

VideoWorld 论文在视频围棋与机器人控制任务中探索视觉知识学习,提供了狭义任务验证;其中机器人评估包含 CALVIN、RLBench 等环境。[20] 不能把仿真控制结果写成开放家庭环境的真实机器人成功率。

Seed3D 2.0 的研究则为物体、材质、场景布局和关节交互提供仿真可用内容。[22] 仿真资产可帮助扩大训练分布,但几何与外观正确,不保证材料参数、接触、磨损与传感器噪声都准确。

本报告判断 D:两条路线可能互补。一条提供从视觉中学到的动态知识,一条提供可执行环境的素材。要构成物理学习飞轮,还缺少或需要明确验证的连接包括:动作与观测一致、物理参数标定、真实失败反馈、仿真收益向真实任务迁移。

这些是可能的研究连接,不是本报告确认已经部署的统一训练管线。

7.4 GR-3 与 GR-RL:真实实验比 demo 更重要

GR-3 技术报告描述结合视觉语言数据、机器人轨迹与人类演示的操作模型,并展示 ByteMini 平台上的真实任务评估。[23] GR-RL 在此基础上研究数据筛选、对称增强和真实环境 RL,提高特定穿鞋带任务的操作表现。[24]

GR-RL 主实验报告基线 45.7%,经过筛选和增强达到 72.7%,在线 RL 后评估为 83.3%。论文另有训练曲线一度超过 90% 的描述;本报告采用评估的 83.3%,不把训练移动平均峰值当最终部署成功率。[24]

这里还有两个容易遗漏的条件。其在线流程不只是“约 150 次尝试”:全文说明此前另用离线训练得到的策略采集了 673 条真实环境 rollout,供相关组件适配;“离线策略”不代表采集这些轨迹没有真机成本。论文也保留了轨迹优化等系统环节,并指出在线 RL 行为漂移与把专用收益蒸馏回通用策略仍待解决。[24]

这些事实支持真实反馈可以提高专用高精度操作能力,但不能证明模型已经普遍理解物理世界,也不能证明只需很少交互就能学会任意任务。

7.5 应怎样比较模拟成功率与现实成功率

本报告没有发现能把上述所有系统按同一任务、同一硬件、同一预算连接起来的公开统一数据。因此不提供虚构的“仿真—真实差距百分比”。

有效比较需要如下协议 D:

比较维度 仿真中固定什么 真实环境中记录什么
任务与初始状态 相同目标、对象与难度分层 初始摆放、对象变化、失败是否计入
传感与动作 时延、噪声、执行器范围 标定、误差、实际动作执行
反馈与干预 奖励规则、重置方式 人类扶正、重置、保护与维修
训练预算 轨迹数、物理时间、计算 真机时间、演示成本、损坏风险
完成标准 完整任务、容许精度 质量一致性、耗时、材料损伤
泛化 未见状态与参数 新环境、操作者、光照和对象

对于企业部署,平均成功率还不够。一天连续运行的尾部故障、恢复时间、是否依赖人工复位,以及失败的经济后果,通常更接近采购决策。

7.6 Digital 与 Physical 的差距是机制差距

本报告判断 D:数字工作可以复制环境、回滚状态、并行试验和快速验证。真实机器人需要物理时间、传感器与执行器,失败会损伤物体或设备,重置往往需要人工。因此两者可能出现数年或更长的部署时间差,但公开证据不足以给出具体年差。

这一判断也需要反证。若高保真仿真、跨硬件通用策略或高效率真机学习出现突破,物理智能可能显著加速。相反,数字工作中权限、验证和客户沟通的瓶颈也可能让数字部署放慢。

应分别记录:数字任务交付率与物理任务交付率,而不是用一张模型能力图为两者确定同一个 ASI 时间表。

八、工业体系:AI R&D 的有效资源不只有 GPU

8.1 训练系统研究提供了比采购传闻更接近使用效果的证据

MegaScale-Omni 论文描述在动态多模态训练负载下解耦并行、重排与负载均衡,称已用于数千 GPU 的内部训练,并报告相对若干系统的吞吐提升范围。[16] Charon 研究则用模拟器预测训练与推理配置表现,支持低成本筛选系统方案。[17]

本报告采用它们证明系统优化方向和作者自报实验,不把最佳配置的倍数提升套到全部训练预算,更不把“部署数千 GPU”扩大为未经核验的十万卡单集群。

分析判断 D:有效计算是硬件、模型、通信和负载共同决定的。 多模态样本长度不均、编码器与语言主干的不同负载、rollout 和训练的资源竞争,都可能使名义规模与可用吞吐差距很大。

这与 AI for AI 有直接关系:若 Agent 能优化配置或找出性能瓶颈,收益可能快速进入下一轮实验;但若只通过微基准,其改善未必在生产负载中保留。

8.2 CapEx、融资与可用算力不能互换

Reuters 2025 年 12 月转述 FT 的 2026 年约 1,600 亿元 AI 基础设施初步投资计划,并明确未能即时独立核实。[39] 2026 年 9 月 Reuters 报道一项 296 亿美元贷款安排,消息人士称主要支持 AI 相关计划,而企业用途口径为一般公司用途。[43]

本报告不将两者相加。贷款是融资工具,CapEx 是投资或采购口径;同一项目可能使用该融资。计划、签署、支付、交付与投产又是不同阶段。

判断 Seed 的资源约束,需要看已经供研发使用的训练小时、实验排队、推理配额和环境容量。即使资金充足,HBM、网络、机架、冷却、并网与软件迁移仍可能限制可用资源。

公司不是上市审计财报意义上的透明样本。外部不能可靠分拆 Seed、云客户、消费产品和其他业务的全部成本。报告因此不估算“字节每个模型花了多少钱”或“每个研究员拥有多少 GPU”。

8.3 芯片报道必须保留冲突

公开消息 来源状态 C 本报告采用的结论
2026-02:SeedChip 与 Samsung 制造谈判报道 匿名消息;字节发言人称相关自研芯片消息不准确 存在报道与官方否认;不能确认计划或产量已实现 [40]
2026-05:定制 CPU,Arm / RISC-V 方向 Reuters 引述消息人士;项目处早期 CPU 路线的报道,不是自研训练 GPU 已量产 [41]
2026-05:Qualcomm ASIC 合作 Reuters 转述 Bloomberg,未独立核实 作为潜在供应路线,不能当现成可用算力 [42]
2026-06:与天数智芯等讨论推理芯片采购 Reuters 消息人士;谈判未最终确认 供应多元化的报道,不等于已交付采购 [44]

这些材料有不同项目、用途和披露状态,不能通过“取平均”消除冲突。一个早期项目被否认,也不证明公司永远不做芯片;另一个项目被报道,也不证明被否认项目已经成立。

本报告判断 D:Agent 规模化会增加 CPU、内存、存储与环境调度负载。每个 Agent 不仅生成 Token,也运行测试、维护文件、操作浏览器和等待外部反馈。自研或多元供应的经济价值,可能来自降低整个任务运行成本,而非单颗芯片的最大 FLOPs。

8.4 电力问题具有地点和时间属性

IEA Electricity 2026 把数据中心列为未来电力增长的重要驱动,并强调电网与灵活性需求。[38] 这是行业背景,不能由此算出 ByteDance 的耗电量。

本报告判断 D:训练集群需要稳定供电与网络;实时助手需要靠近用户的低延迟服务;后台研究任务可以在一定程度上接受时间或地域调度。三种工作负载的选址和电力弹性不同。

廉价发电不等于可用数据中心。并网容量、建设时间、冷却条件、芯片可获得性、跨区域通信及运营规则共同决定项目能否投入使用。

持续 Agent 的资源账还需要把空闲等待计算清楚:一天在线不代表一天满载 GPU。若能将推理、实验与后台状态有效拆分,系统可以节约资源;若每个任务长期占用完整环境,成本会随并发数急剧增加。

8.5 工业约束也可能改变技术路线

本报告提出三条条件推断 D,而非既成事实:

但约束不会自动制造突破。软硬件协同和模型压缩可以改善效率,也可能增加兼容性和研发复杂度。应追踪完成同样任务的总成本,而不是假定限制必然催生更优技术范式。

九、产品与生态:流量什么时候能成为学习优势

9.1 多个产品入口不能直接组成一个数据飞轮

Seed 官网呈现面向应用与企业服务的模型渠道。[1] 扣子、TRAE 和开源 Harness 等又分别提供工作空间、工具执行和开发功能。[13][28][31]

本报告判断 D:这些入口可以降低获客、部署和观察真实问题的成本。但形成研究优势至少需要完成下面四次转换:

使用事件 → 可诊断反馈 → 获准使用且有质量的经验 → 进入训练后在陌生任务上有收益。

第一步会筛掉大量无明确结果的对话;第二步需要识别是模型错误、需求不清还是工具故障;第三步涉及数据授权、敏感信息与去重;第四步则需要训练和独立验证。每一步都有损耗。

假设模型每天处理更多 Token,并不能说明有更多新信息。长 Context、视频编码、内部应用、重复推理、价格补贴与模型路由都会改变调用量。没有统一口径,跨公司 Token 数比较尤其容易误导。

因此本报告没有将网上流传的巨额日调用量、未经查明作者与统计口径的文章数字写入领先指标基线。公司官网上的技术说明、正式文档与平台文章不能只因同域名就获得相同证据权重。

9.2 扣子的当前形态:协作与持久运行,同时有产品迁移

截止日可访问的扣子 FAQ 描述 3.0 中的多人、多 Agent 项目、独立上下文、文件与产物保留、本地和云端 Agent 接入等功能。文档同时明确,某些名为 Codex CLI 或 Claude Code 的云端 Agent 使用的是平台模型或开源框架,并不直接等于对应厂商官方产品或用户原有账户。[28]

这说明字节在产品层探索 Agent 组织与长期工作空间,但不能证明这些组织已经产生超过人类团队的 collective intelligence。

产品边界需要按具体服务核验:

功能变化 当前一手文档 B 正确解读
扣子中的新编程项目入口 自 2026-09-08 不再新建该类项目;改用 Agent 调用编程与部署插件,已有项目不受影响 工作入口迁移,不等于所有编程能力取消 [29]
扣子编程 OpenClaw 项目 自 2026-06-30 不再新建旧项目;存量继续;提供扣子 3.0 云端 Agent 替代方式 高运维成本推动产品形态调整,不等于 OpenClaw 整体下线 [30]
本地 Agent 与云端 Agent 访问范围由具体接入方式决定 云端隔离承诺不能套用到主动授权本地设备的模式 [28]

本报告判断 D:这种调整是持久 Agent 的现实经济信号。产品方需要在环境资源、协作、运维与交互成本之间取舍。不能只按发布时的“永远在线”宣传判断当前服务,也不能把入口整合自动解释为研发失败。

9.3 TRAE / SOLO:代码逐步成为工作流中的一个阶段

TRAE 的 2026 年 3 月官方说明,将新版 SOLO 描述为共享项目工作空间的 Code 和工作任务模式,包含文档、分析、报告等产出,并区分桌面与云端使用。该公告当时为分地区、分阶段 beta;本报告不据此声称截止日所有地区已经同等开放。[31]

分析判断 D:一个编程 Agent 一旦能够读取需求、分析数据、创建交付文件和运行代码,其商业边界会从“代码编辑器”扩展到项目推进。但扩展产品范围,不等于每项专业工作都已达到专家质量。

对于企业,关键评估不是“它可生成多少格式”,而是资料是否被正确使用、结果是否可以复查、前后阶段是否共享正确状态,以及是否减少整合劳动。

9.4 开源扩散是一种路线,不能简化为所有权开放

Seed-OSS 官方仓库提供 36B 模型及不同预训练数据版本,并说明开放许可和长上下文、推理预算等设计。[32] coze-studio 提供开源的 Agent 开发平台。[33] verl、TARS 与 DeerFlow 又分别开放不同训练或运行组件。[12][13][14]

这些对象的开放范围不同:模型权重、训练数据、完整配方、执行框架、云服务和产品账户,应分别核验。开源平台不能自动获得云端商业版的全部能力;某个开放模型也不能自动继承最新闭源前沿模型的能力。

本报告判断 D:开源可以扩大工程采用、降低组合成本、形成事实接口与研究基线。但它未必使企业掌握数据、执行身份、服务渠道和最终分发。开放技术与集中控制可以同时存在。

对中国生态,更重要的观察是不同模型和系统能否互操作,以及企业能否携带工作流、数据与评测迁移。用闭源或开源二分法评价整家公司,会遮蔽这些实际边界。

9.5 内容平台与用户 Agent:目标函数可能冲突

本报告讨论的是结构性可能 D,不声称某一产品目前秘密操纵用户。

内容平台通常需要决定用户看到什么;用户 Agent 则需要代表用户决定应看什么、买什么或忽略什么。如果一个 Agent 的最佳行动是减少用户停留、拒绝广告推荐、选择平台外更便宜的商品,平台商业收益与用户目标可能发生冲突。

Agent 权限扩大之后,这种冲突不再只是“推荐是否公正”,还可能涉及行动:订单、退款、订阅和内容发布。真正的用户代理关系需要回答:当用户利益与平台收益不同,系统以谁的目标为准?

可验证的产品标准包括:商业关系披露、可配置目标、平台外选项、决策理由、行动日志、可撤销权限、数据导出与迁移能力。不能仅用“个性化”或“懂你”判断归属。

9.6 跨平台 Agent 的瓶颈可能是授权与商业接受

Reuters 报道 2025 年 12 月豆包语音助手与 ZTE 手机合作;随后有来源的报道记录了其他应用限制功能、字节调整能力的情况。[49][50]

这些事件只证明当时存在入口与平台限制,不代表截止日每个 App 仍执行相同措施,也不证明全部限制都出于商业防御。安全、隐私、接口规范和平台利益可能同时存在。

本报告判断 D:跨 App 智能不只取决于“能看懂屏幕”。支付确认、身份认证、反自动化和服务条款决定系统能调用哪些资源。技术成功率与获得合法、稳定行动权应分开监测。

生态内闭环较容易建立,也更可能形成供应商锁定。生态外工作更有用户价值,却需要清晰授权和协作协议。这个张力可能决定 Agent 平台的商业边界。

十、Control:反馈越强,越需要独立于反馈的边界

10.1 已公开什么,尚未验证什么

Seed 官网设有 Transparency 页面,提供部分模型训练内容摘要。[45][46] Responsible AI 招聘材料说明团队研究可靠、安全与可信 AI,并参与产品安全与伦理工作。[47] TARS 仓库也公开幻觉、资源消耗和潜在滥用等限制。[12]

这些是实质披露,但性质各异。数据透明摘要不能替代 Agent 行动风险评估;招聘不能证明特定风险已被解决;列出限制也不等于已经建立了对所有风险有效的控制机制。

在本次查阅范围内,报告没有找到足以逐项核验 Seed 全部前沿模型的统一公开危险能力门槛、触发后的部署动作与独立审计结果。因此相关指标记为“公开证据不足”,不记为“无安全工作”或“安全风险低”。

10.2 按 Agent 的权限,定义控制对象

下表是本报告建议 D,而非 Seed 产品当前全量保障清单。

能力增长 对应风险 控制应验证什么
长任务与持久记忆 错误状态长期累积 状态版本、来源、过期和删除是否生效
浏览与工具调用 外部指令污染目标 不可信内容能否改变授权和任务范围
多 Agent 协作 权限合并、相关错误 角色隔离、任务交接、共享文件边界
训练与数据生成 偏差进入下一轮权重 数据审查、隔离评测、可追溯版本
AI R&D 资源调用 预算失控、危险实验 资源配额、实验白名单和停止路径
Computer Use 与支付 重复执行、错误身份 幂等、确认、撤销和审计
机器人执行 人身、物体与设备损伤 物理限位、急停、故障恢复和现场监督

判断标准不是系统是否愿意说“我遵守规则”,而是它在模糊、冲突和诱导情境中是否保持边界。能力越强,控制测试越应覆盖替代行动路径,防止系统用未受约束的工具实现同一结果。

10.3 Harness-IF 的意义:成功与服从应分别验收

Seed 公开论文目录列出 2026 年 8 月 Harness-IF,摘要提出在多个指令载体上通过执行证据评估操作规则,并区分真正遵从与模型本来就会这样做的情况。[53][54]

本报告可访问摘要,但完整正文获取受限,因此不引用未经细读的分项百分比,也不据此评价 Seed2.1 的具体控制水平。

方法启示 D 是明确的:如果要求“不改动某个文件”,而 Agent 恰好不需要那个文件,成功完成任务并不能证明它尊重该约束。更有力的测试需要让遵守规则与默认高分策略发生真实冲突。

AI R&D 中尤其需要这一做法。若禁止修改测试集,系统必须在修改测试可以提高分数时仍然拒绝;若限制实验预算,必须在增加预算可能获得更好结果时仍然遵守。只在没有诱因的场景测试规则,容易高估控制。

10.4 奖励闭环与安全闭环可能分离

本报告判断 D:任务分数提升并不保证控制提升。模型可能更善于满足一个奖励,而同时更善于找出评分与真实目标的差异。

TaskMem 论文讨论了奖励被简短、缺少实质内容的输出利用,需要增加记忆丰富度等设计。[8] 这是一项受限训练中的奖励问题,不是对真实产品恶意行为的指控,却说明“有自动评分”不等于“评分足够”。

控制设计应独立于任务奖励,包括未经授权不能跨越的权限边界、保留原始证据、审计不由执行者自行决定、停止系统时能够回收凭据与子任务。

一个 Agent 进程被终止后,若后台任务、外部 API 凭据或云端子 Agent 仍可继续操作,就不能算完整中止。控制对象是行动系统,而不只是一个对话窗口。

10.5 数据回流与客户信任存在明确边界

火山方舟相关官方文档的可检索内容说明,在相应图片和视频理解服务中,不保留用户提交内容用于模型训练。[48] 这是具体服务文档范围内的说明,本次正文抓取受限;报告不把它扩大为所有字节产品统一的数据承诺。

分析判断 D:应用规模可能产生产品反馈,却不能假定所有客户原始内容都可直接进入训练。企业若主动授权回流,也需要确定哪些字段、哪些用途和哪些派生数据被包含。

数据治理不是研发飞轮之外的阻碍,而是使高质量反馈能被持续使用的前提。如果客户因无法控制数据而不愿把重要任务交给 Agent,系统得到的反馈将停留在低价值和低敏感度场景。

十一、竞争解释与反证:避免把一切进展拼成必然起飞

11.1 四种解释都能解释部分现有事实

解释 如何解释 Seed 的公开进展 哪个观测最有区分力
E1 产品与工程追赶 通过评测、RL、成本优化和渠道,快速改善可用性 收益是否主要集中在现有产品任务
E2 环境学习范式扩展 利用有反馈任务与经验蒸馏,提高学习效率 跨任务、跨分布、跨轮保留是否持续
E3 AI R&D 正反馈 AI 开始改善制造下一代 AI 的方法 固定资源下,连续代际研发能力与周期的因果变化
E4 工业规模优势 资金、集群、部署与组织资源带来竞争力 扣除资源增长后,单位有效资源产出是否提高

本报告当前认为 E1、E2 与 E4 有较强的公开线索;E3 已有局部工程方向,公司的持续前沿反馈仍未验证。它们不是互斥情景,也不能用“看上去符合起飞”把其余解释排除。

11.2 需要主动挑战的八项叙事

  1. “任务跨几十天,所以已有几十天自主研发能力。” 必须澄清干预、等待、状态维护与验收。跨度不是 Horizon。
  2. “经验写入权重,所以已出现通用 RSI。” 任务专用训练与自主改善研发方法不同;跨轮收益也不自动跨领域。
  3. “拟合出 Scaling Law,所以能力可按指数预测。” 拟合、外推与因果机制需要分别检验。
  4. “多 Agent 的组织形态就是集体超级智能。” 存在角色与消息不是证据;应测协调之后的净产出。
  5. “视频看起来真实,所以模型理解物理。” 反事实、分布外与真实控制实验才有判别力。
  6. “用户越多,训练数据越好。” 用户量不提供自动授权,也不提供可靠奖励。
  7. “采购或自研芯片规划代表算力瓶颈解决。” 计划、交付、软件适配与有效吞吐应逐项验证。
  8. “没有公开统一安全框架,所以没有做安全。” 信息缺口不能直接推定内部事实;同样不能据此假定控制成熟。

11.3 最可能使本报告核心判断失效的证据

本报告以反馈转化为持久能力作为关键机制。至少四种证据会迫使我们下调其解释力 D:

也有三类证据会提高置信度:多个独立团队复现跨轮保留;陌生工具和研究问题上的迁移;固定总资源下连续前沿研发周期缩短且质量保持。

“尚未证明研发起飞”不是押注它不会发生。研究纪律要求:当强证据出现,及时上调判断;在强证据出现之前,不把可行方向写成已实现状态。

十二、未来 3—10 年情景:用转折点替代 ASI 年份

以下是 D 类条件情景,观察窗口约为 2029—2036 年,不是事件发生年份预测。本报告不赋予数值概率:现有公开资料不足以校准这些概率。

情景 A:持续 Scaling 与 Agent 改进,没有明确 AGI 日

前提: 预训练、后训练和运行工程仍有收益;经验学习进步,但没有形成显著加速的研发方法反馈。

领先指标: 固定任务集的验收率提高;人工接管减少;单位有效任务成本下降;更多业务流程可在清晰边界下交付。

可能结果: 字节依托产品入口和模型渠道扩大实用 Agent 市场。企业感受到的是工作分工改变,不是某一天突然跨过智能阈值。

风险: 工作流改进与市场宣传脱节;产品整合增加锁定;流量增长无法覆盖持久运行成本。

上调证据: 多季度出现质量、成本、介入率的共同改善。下调证据: 更大预算只能维持同等质量,或真实流程失败率长期高于基准。

情景 B:AI R&D 出现显著正反馈与 Takeoff

前提: Agent 不只实施方案,还能提出、验证并推广研发方法;收益进入下一代,且验证、算力和实验环境跟得上。

领先指标: 被采用的 AI 原创研发提案增加;同等预算下研发周期缩短;新模型更擅长改进训练与研究;跨代收益有可追溯数据。

可能结果: 研究竞争从单次模型发布转向研发系统效率。具有训练系统、验证环境和经验资产的公司获得更大累积优势。

风险: 自动评测被利用;隐藏故障进入训练;监督负担增长;能力与部署控制不同步。

上调证据: 至少多代可比因果序列、独立复现和资源归一化结果。下调证据: 收益停留在软件实现,新增质量完全由更多预算或人类研究解释。

情景 C:Compute、Energy、验证或 Control 成为主要瓶颈

前提: 模型能提出更多行动,但工业资源、现实验证、权限或监督不能按同一速度扩张。

领先指标: 实验排队增加;推理配额和产品形态调整;单位交付成本不降;验证团队成为主要人力负担;平台限制影响可执行任务。

可能结果: 技术路线转向更小模型、专用策略、路由、批处理与更强资源纪律。部署速度低于模型测评进度。

风险: 降价与补贴掩盖真实成本;为降低摩擦而过度放宽权限;供应集中使企业工作流脆弱。

上调证据: 已交付资源不足、长期排队或监督成本持续增长。下调证据: 软件效率、供应多元化和可控运行明显改善单位交付成本。

情景 D:新技术范式降低经验学习或预训练的关键成本

前提: 持续学习、架构、扩散语言模型、世界建模、软硬件协同或其他方向,产生超出当前配方的广泛收益。列举方向不表示 Seed 已实现某一突破。

领先指标: 固定计算下新分布能力提升;参数更新不明显遗忘;极少反馈就能稳定学会陌生任务;独立团队复现。

可能结果: 当前按参数、Token 或 Agent 数衡量的竞争被重新定义。Seed Edge 等长期研究机制可能受益,也可能由其他公司首先突破。

风险: 精选任务与最佳配置掩盖泛化不足;新架构引入难以审计的状态与控制问题。

上调证据: 跨任务、跨模型、跨团队结果与清晰机制。下调证据: 仅在一类基准有效,工程整合之后优势消失。

情景 E:商业分发成功,但通用研究停滞

前提: 消费、创作和企业产品持续改善,收益却主要来自产品化和现有能力组合。

领先指标: 用户和收入增长,但环境学习迁移、原创研究与跨代研发能力没有同步改善。

可能结果: 字节成为强大的 AI 应用与工业平台,同时无法证明通用超级智能的形成。这是完全可能且商业上有价值的结果。

风险: 分发与研究的成功被混用,资本配置被无法证伪的 AGI 叙事牵引。

上调证据: 产品指标与研究指标长期脱钩。下调证据: 产品失败数据明确转化为可迁移的研发与基础能力收益。

情景之间如何转移

本报告建议按瓶颈变化判断,而非按模型名称判断。若 A 中的工作流收益进入研发方法,并在多个代际中保留,则转向 B;若能力提高而有效实验和控制停滞,则向 C 移动;若新的机制改变学习效率并被广泛复现,则提高 D 的权重;若只有商业扩张而没有研究机制进步,则提高 E 的权重。

一个季度可以同时存在多个方向。例如数字产品进入 A,某个局部研发模块呈现 B 的先兆,机器人仍受 C 限制。不能给整家公司贴上单一“起飞”标签。

十三、季度领先指标仪表盘:监测能力形成,不追问 AGI 是否到了

13.1 指标设计原则

仪表盘是本报告提出的可更新框架 D;下表“基线”只表示目前证据状态。没有公司公开数据的指标明确写未知,不用实验室总体趋势代填。

每次更新同时保存模型版本、运行系统版本、工具、总预算、成功定义、失败记录、人类介入与数据来源。若任一条件改变,先报告口径变化,再比较趋势。

编号 指标 建议定义与分母 2026-10-06 基线 更新频率 / 触发证据
01 跨领域能力 固定任务组、逐领域结果,不只总分 官方评测丰富;第三方可比性不完整 [2][3] 季度;新模型加独立复测
02 人类任务 Horizon 人类完成时长对应的 50% / 80% AI 成功阈值 未核验到 Seed 可用的同口径完整估计;不得以任务跨度代替 [34] 有新独立测量即更新
03 完整 Agent 验收率 所有启动任务中最终验收通过比例 缺统一真实业务样本 月度内部、季度汇总
04 人类介入 每任务介入次数、人时、原因 Seed for Seed 未统一披露 按难度、成功失败分别记
05 失败恢复 注入故障后完成率与新增成本 有专用恢复研究 [9][11][24] 固定故障集季度复测
06 运行中学习收益 同预算、有反馈相对无反馈的改善 EdgeBench / CoE 提供研究协议 [6][51] 固定任务、固定预算复现
07 上下文清空后保留 清空经验后的增益 / 保留经验的增益 Experience Distillation 有受限实验 [52] 每轮学习后测量
08 跨任务迁移 未参与经验收集的任务上的净收益 有 OOD SWE 实验;广泛领域未知 [52] 季度扩大盲测范围
09 持续轮次的边际收益 每轮单位成本的新能力增量 有有限多轮实验,长期斜率未知 [52] 多轮连续序列
10 记忆质量 准确、相关、过期删除、污染与退化 TaskMem 提供研究起点 [8] 月度;模型/记忆策略更新
11 AI R&D 工作覆盖 按评测、数据、训练、算法、Infra 分阶段记录 官方称覆盖多环节;占比未知 [2] 季度审计任务记录
12 AI 提案采用率 独立验证并被合入的提案 / 全部候选 公司级数据未知 同时记录拒绝原因
13 研发周期 同质量目标下从定义到可部署版本的日历时间 可比公司序列未知 每代;归一化人员与算力
14 跨代研发反馈 下一代研发能力中可归因于前代 AI 成果的增量 未验证 多代追踪,独立审计
15 新知识 被外部复现的新发现 / 全部候选 专用科研自报结果;通用序列不足 [18][26] 半年;分级终点
16 多 Agent 净收益 固定总预算、权限下相对单 Agent 的提升 有产品组织形态,缺统一 Seed 效果 [28][36] 季度架构对照
17 有效并发 单位时间验收产出、尾部时延和冲突 未公开可比整体数据 月度运行数据
18 Verifier 吞吐与质量 通过独立复查的结果 / 验证资源 数学反馈较明确;通用研发未知 [18][19] 季度;审查误判
19 World Model 实用收益 用预测规划相对不用预测的真实任务收益 有局部研究,广泛现实连接未验证 [20][21][22] 跨分布、跨环境评测
20 真实机器人交付 完整任务成功、耗时、干预、损伤与恢复 GR 系列有局部真实实验 [23][24] 同任务、同硬件复测
21 已交付有效 Compute 可用训练/实验吞吐与排队,非承诺金额 有系统论文;完整集群资源未知 [16][17] 季度,交付与投产分别记
22 单位验收任务成本 推理、工具、环境、验证和运维总成本 不宜用 Token 单价代替 月度、模型切换前后
23 可用电力与工业延迟 实际可用容量、并网与交付日期 公司级完整基线未知 项目投产时更新
24 Control 与归属 越权、注入、停止、日志、导出与迁移的测试结果 部分披露;统一可比结果不足 [12][45][47][53] 每次权限或运行系统变更

13.2 不建议汇总成一个“ASI 指数”

不同指标不能轻易线性相加。模型能力提高不能抵消越权事故,低价不能抵消错误交付,大量并发不能抵消验证失败。一个综合分会遮蔽决定下一阶段的瓶颈。

更实用的季度结论是:哪三项进步得到强证据,哪两项成为瓶颈,哪些未知已经缩小,哪些判断需要撤回。

可采用证据状态而非宣传色彩:已独立复现、公司自报有实验、仅功能披露、证据缺失、出现反证。 同一指标可同时有自报进步与独立反证,二者都应保留。

13.3 最优先跟踪的五项

对判断“Seed 是否进入智能增长反馈”,本报告优先选择:AI 提案独立采用率、研发周期、清空上下文后的保留、跨任务迁移、多轮收益的边际成本。

这五项能区分“生成更多成果”“工作流更顺畅”和“系统持续提高制造智能的能力”。GPU 规模、流量与模型榜单作为解释变量记录,不替代这五项。

十四、对企业、OPC 与个人的意义

本节为 D 类建议,针对工作机制而非即时产品购买推荐;具体产品可用性、价格、数据条款与授权需在实施时再核验。

14.1 企业应购买可验收能力,而非“数字员工人数”

Seed 生态最值得企业试验的任务,是资料输入明确、工具范围明确、结果可验收、失败可回滚的流程。任务是否“看起来高级”并不重要。销售复盘、数据清洗、报告初稿、代码维护和内部检索,都可能产生价值,但质量标准要由真实业务决定。

一个流程的价值可按以下方式核算:节省的人时和新增收益,减去复查、返工、错误损失、系统集成与维护成本。不能只用 AI 输出所需时间替代原流程成本。

尤其要检查最后一公里:报告形成后谁决策,订单创建后谁确认,代码运行后谁维护。若这些环节没有负责人,自动化会把问题转移给后续团队。

14.2 OPC 的优势可能来自可验证的小系统

一个人协调多个 Agent,并不自动拥有一家大公司的能力。OPC 最有机会的领域,是自己掌握业务判断、客户沟通和验收标准,同时让 Agent 承担可定义的工作段。

核心资产包括客户特定流程、数据结构、工具连接、失败经验和质量检查。通用提示词容易复制;经过真实业务验证的任务环境和验收协议更难复制。

本报告建议从一个有清晰结果的流程开始,保留失败案例与人工接管原因,然后决定需要改模型、改工具还是改任务定义。不要把所有失败都归于模型能力不足,也不要过早堆叠 Agent。

14.3 企业 AI 顾问的工作重心会变化

研究型模型和更成熟 Harness 会降低原型创建成本。顾问更应承担需求澄清、数据权限、工具集成、验收设计、异常处理和持续运营。

这与“只交付一个聊天机器人”不同:一个业务流程通常包含不同角色、不同权限和不同完成标准。顾问需要判断哪些阶段可以自动执行,哪些需要人类判断,哪些应改造原流程。

本报告建议将交付物定义为四件事:可运行流程、验收数据、权限与操作说明、维护及回滚方式。模型名称只占其中一部分。

14.4 个人应保留自己的长期工作资产

持久 Agent 能降低重复解释成本,同时可能让工作状态依赖某个平台。个人应关注文件可导出、任务记录可携带、技能可迁移与权限可撤销。

“代表我工作”应表现为可以检查行动、理解它使用了哪些资料,并决定哪些目标和资源继续授权。一个总能给出令人满意解释、却不能让人复查结果的 Agent,不足以成为可靠代理。

14.5 一个可执行的八周验证流程

以下是组织试点建议 D,不是 Seed 产品性能保证。

时间 任务 应得到的证据
第 1—2 周 选择一个高频流程,定义真实完成标准,采集历史任务 人类基线、失败成本与权限边界
第 3—4 周 用固定版本模型与运行系统回放任务 全部成功失败、介入人时和总成本
第 5—6 周 仅改一个关键变量:反馈、记忆、工具或模型 可归因的质量变化与反例
第 7—8 周 在新任务上盲测,测试停止、回滚与迁移 能否扩大使用的依据

试点不需要先判断 AGI 是否到来。只要流程有净收益并保持可控,就值得继续;若没有,则用失败数据定位瓶颈,而不是用更宏大的技术愿景解释。

十五、关键未知与最终判断

15.1 目前不知道的十件事

  1. Seed 全部研发工作中,AI 的实际覆盖、人时替代与质量贡献各是多少。
  2. 官方描述的长跨度任务包含多少干预、等待和工程维持。
  3. AI 提出的算法或研究方案中,多少通过独立验证并进入前沿训练。
  4. Seed for Seed 是否已经连续影响多代前沿模型,以及净加速幅度。
  5. 经验蒸馏在更广领域、更长轮次和更强模型上的迁移与遗忘表现。
  6. 多 Agent 相对同预算单 Agent 的长期净收益,以及可控并发规模。
  7. 最新闭源模型的完整训练计算、参数结构和全部关键配方。
  8. Seed 可用资源在训练、推理、研发 Agent 与产品之间如何分配。
  9. 全部前沿能力风险门槛、部署触发动作及独立 Control 评估结果。
  10. 世界模型、机器人、科研和通用 Agent 是否已在内部形成统一学习系统。

这些问题均不能用公司愿景、匿名参数传闻、招聘岗位或视频展示填补。

15.2 本报告采用的最终判断

ByteDance Seed 已经成为研究 AI 如何从使用经验中持续改善的一个重要对象。 支持这一判断的证据不是一个最高分模型,而是覆盖环境学习、参数保留、错误恢复、专用验证、训练系统和官方研发使用的多条公开线索。[2][6][8][9][14][18][24][51][52]

本报告进一步判断 D:它可能具备把研究、应用与工业资源连接起来的条件;真正的竞争优势取决于这些连接是否产生经过验证、可保留、可迁移的收益,而非每个环节单独扩张。

目前能够成立的是:官方披露的研发闭环,以及受限实验中的多轮能力积累。尚不能成立的是:前沿通用智能已经出现持续递归研发起飞,或整个系统已超过大型人类组织。

未来最值得盯住的转折点,是每单位资源产生的已验证新知识与研发改进是否持续提高,且下一代系统比上一代更善于获得这种改进。若出现这样的序列,超级智能形成机制就会从可能连接变成可观察事实;若没有,产品和工程成就仍有价值,但应按其真实范围评价。

十六、来源目录与核验说明

所有来源于 2026-10-06 核验。动态页面日期记为“截止日快照”;论文同时记录首次公开日期或所用修订版。下面列出的页面用于支持正文相邻的具体论述,不代表已核验站内所有内容。无全文访问的材料注明范围,不用摘要推断内部细节。

官方模型、研究与工程资料 B

独立测量、外部研究与权威统计 A

产业与平台事件 C

透明度、数据与新增经验研究 B

来源使用与复核记录

本报告特别复核了六类误读:模型发布日期与论文日期;论文早期版与修订版;运行跨度与人类任务 Horizon;训练曲线与正式评估;采购规划与交付资源;产品入口调整与能力整体下线。

未采用维基、匿名社区帖子或聚合榜单作为关键技术结论依据;未用同一研究的官方博客和论文冒充两项独立验证;未把不可访问正文的来源扩展成完整阅读;未从跨公司安全事件推断 Seed 发生过相同事件。

下一版应优先补充独立的经验蒸馏复现、Seed 同口径 Horizon、研发周期审计和现实工作流验收数据。只有新增这些证据,才能实质提高关于智能增长机制的判断强度。