研究截止:2026 年 10 月 6 日
报告性质:独立专题研究;公开资料分析;版本 GPT V1.0
研究对象:ByteDance Seed,以及与其能力部署相关的字节跳动产品、研究与基础设施。
本报告从公开资料重新建立判断,不把产品名称、模型发布频率、平台流量或管理层愿景作为超级智能已经形成的证据。研究截止日是资料核验日期,并不表示每条来源都在该日发布。对动态文档,采用截止日可访问的内容;对论文,优先采用已核验版本。引用编号对应文末来源目录。
执行摘要
本报告判断:ByteDance Seed 最值得研究的地方,是它正在尝试把模型使用过程中产生的反馈,转化为下一轮模型与系统改进的输入。这个机制已经有若干工程实例和受限实验支持;它是否足以提高前沿智能的长期增长速度,目前仍不知道。
这家公司不宜只用“豆包用户多”“视频生成强”或“中国的大模型竞争者”解释。研究端存在几条相互关联、又不能混为一谈的路线:通用 Agent 的模型训练;运行中的环境学习;经验向权重的蒸馏;评测、数据和训练基础设施中的 AI 辅助研发;形式数学、生命科学与机器人中的专用验证闭环。它们共同指向一个更具体的问题:一次成功或失败,怎样成为系统下一次工作的能力,而不只是留在一次会话里? [2][6][8][9][18][24][51][52]
本报告形成七项核心判断,均属于研究综合判断 D,其事实基础和限制在正文展开。
- AI for AI 已有明确的官方研发使用披露。 Seed for Seed 涉及的工作超过代码补全。但公开材料尚不足以计算 AI 对整个研发周期、研究质量或下一代模型能力增量的净贡献。[2]
- 持续改进存在不同层次。 利用上下文反馈、更新任务记忆、训练专用策略、跨轮蒸馏经验、研发下一代通用模型,是不同的机制。把前四项合并称为“递归自我改进已发生”,会抹掉最重要的证据边界。[6][8][9][19][51][52]
- 经验保留是比“Agent 能运行多久”更有解释力的变量。 运行更久只有在反馈有效、错误可定位、经验可保留且收益可迁移时,才可能变成持久能力。持续在线和持续学习不能互相替代。
- Seed 的路线同时保留中心模型与系统组合两种可能。 原生 Agent 模型减少模块间的信息损失;Harness、工具、沙箱和验证器提供模型权重之外的能力。公开证据支持两者协同,尚不足以支持“超级智能一定首先是多 Agent 系统”。[11][13][36]
- 字节的应用与基础设施可以降低研究部署之间的摩擦,但无法自动产生优质训练数据。 流量包含大量冗余、弱反馈、商业目标和权限限制;客户数据还受到产品条款与授权约束。需要研究的是有效反馈产出,而非总 Token 数。
- 物理智能有实质进步,也有清晰的任务范围。 真实机器人强化学习比视频演示更接近有效证据,但任务专用策略的收益不能直接外推到通用家庭机器人。Digital 与 Physical 的进展应分别监测。[20][21][22][23][24]
- 最可能先出现的优势是可验证工作流的规模化,而非一个明确的 AGI 发布日。 一旦验证吞吐、经验迁移与研发周期同时改善,才有理由上调 AI R&D Takeoff 情景;单项榜单、模型参数传闻或投资计划都不够。
报告采用一个分析框架:反馈质量 × 经验保留 × 跨任务迁移 × 实验吞吐 × 可控资源调用。这是用于追踪因果关系的框架,不是经过拟合的能力公式,也不对各因子赋予伪精确权重。任何一个环节接近失效,其他环节的规模扩张都可能只制造更多低质量尝试。
一、研究问题、证据纪律与对象边界
1.1 六个真正需要回答的问题
本次研究没有先按产品划分章节,而是先提出六个需要证伪的问题。
| 研究问题 | 支持该机制需要看到什么 | 什么会削弱它 |
|---|---|---|
| AI 是否已进入 AI 研发闭环? | 有真实任务、实验反馈、被采用结果及研发阶段记录 | 仅演示代码生成;采用率和周期贡献未知 |
| 环境中的改进能否保留下来? | 清空上下文后仍有收益;更新权重或持久状态的可重复结果 | 只是在同一任务中反复尝试;离开反馈环境即失效 |
| 保留的经验能否迁移? | 新仓库、新任务、新工具及新分布上的提升 | 同题记忆或评测过拟合;跨任务退化 |
| 应用规模能否提高智能增长速度? | 有效失败数据、清晰奖励、可用授权和回流链路 | Token 增长主要来自免费补贴、长输出、重复请求 |
| 模型和系统谁决定上限? | 固定预算的架构比较与模块消融 | 更多 Agent 只扩大花费或相关错误 |
| 工业资源与控制能否跟上? | 已交付算力、可用环境、验证能力和权限边界同步扩张 | 资本承诺无法变成可用实验资源;监督成为瓶颈 |
这些问题不要求先认定 Seed 的路线正确。相同事实可能有两种解释:它可能是智能增长反馈机制的早期工程化,也可能主要是一套更高效的产品与研究组织。报告保留这两种解释,并追踪能够区分它们的指标。
1.2 证据等级不是可信度的一维排名
| 等级 | 本报告含义 | 使用纪律 |
|---|---|---|
| A | 独立研究、第三方测量、权威统计;标明预印本或其他限制 | 独立不等于无误,也不等于直接测过 Seed |
| B | 公司一手披露、官方仓库、由公司参与的技术论文 | 证明公开路线与自报实验;自报能力仍需复现 |
| C | Reuters、FT 等媒体,以及有来源的新闻报道 | 匿名消息、转述与官方否认分别标明 |
| D | 本报告的分析、机制模型、情景及建议 | 不能伪装成实验结果或内部事实 |
特别处理三种容易混淆的情况:
- Seed 论文即使进入学术会议,在其自家系统的效果评估上仍标为 B;同行评审改善质量控制,不使实验自动成为第三方复现。
- Google/MIT 等参与的多 Agent 研究,相对于 Seed 是外部研究,可用作 A 类比较证据,但其团队也具有行业利益,结果只适用于相应实验范围。[36]
- 关于“目前没有找到”的结论,是本次公开资料审查的范围结论,不是对实验室内部的否定证明。
1.3 Seed 不等于整个字节,也不等于豆包 App
Seed 官方将团队起点写为 2023 年,研究覆盖通用智能相关方向。截止日官网列示 Seed2.1、Seedance 2.5、Seedream 5.0 Pro、SeedRealtime、Seed Audio 1.0 与 Seed GR-RL 等不同模型或研究框架。[1]
本报告区分五个层级:
| 层级 | 研究对象 | 不应直接推导的结论 |
|---|---|---|
| 研究团队 | Seed、Seed Edge 与联合研究项目 | 不等于所有字节 AI 研发均由同一组织负责 |
| 模型 | Seed 通用系列、TARS、Prover、生成与具身模型 | 不等于所有模型已整合进同一个权重系统 |
| 运行系统 | Harness、工具、沙箱、记忆、验证与调度 | 不等于基础模型自身已获得这些功能 |
| 产品与渠道 | 豆包、扣子、TRAE、火山方舟、BytePlus 等 | 产品发布不等于某一模型的独立能力提升 |
| 公司资源 | 采购、融资、云基础设施、商业化渠道 | 公司总预算不等于 Seed 的训练预算 |
同一公司可以有共享基础设施,也可以有独立业务目标。将每个产品、论文和采购消息都拼成一个统一的“超级智能架构”,会制造不存在的组织确定性。
1.4 当前资料的缺口
截至截止日,本报告未获得 Seed 全部研发阶段的 AI 使用占比、统一的人类介入定义、跨代研发周期的可比序列、完整集群清单或由独立机构验证的持续前沿研发反馈数据。
这限制了结论强度,但不使已披露的局部工作失去意义。研究任务是识别哪些因果链已经有证据,哪些只是可能连接,而不是用“未披露”填零,也不是用公司规模填补未知。
二、Seed for Seed:从研发工具到智能增长反馈,跨过了哪几步
2.1 官方披露已经超过 coding assistant
2026 年 6 月 23 日的 Seed2.1 发布说明明确描述 Seed for Seed:模型进入评测、数据、训练、研究与 Infra 环节,任务包括评测系统开发、能力诊断、SFT 数据合成、RL 框架优化,以及通过代码和实验实现、验证研究论文方法。官方还描述了依据中间结果反复诊断、修改、验证,复杂任务可由不同角色的 Agent 协作。[2]
证据结论:存在官方披露的 AI→AI 研发工作流。 这比“模型能写 Python”更强。限制:这一披露没有提供足以独立估计整个研发管线净加速的对照数据。
尤其不能把官方所说任务可跨越小时、数十小时乃至数十天,转换成“模型具有数十天的无干预人类任务 Horizon”。跨度可能包含实验等待、阶段性人类决策、多个 Agent 或工程系统维持,测量口径并未统一。[2][34]
2.2 研发闭环分为六层
以下是本报告提出的分层方法 D,编号只表示证据要求递进,不表示公司已经逐层通过。
| 层次 | 改进的对象 | 最低证据要求 | Seed 当前公开材料的状态 |
|---|---|---|---|
| R0 工具辅助 | 人的代码、文档、检索 | 任务效率或成果质量 | 已有产品和研究使用披露 |
| R1 工作流闭环 | 具体研发任务 | 实验→诊断→修改→再实验 | Seed for Seed 官方披露支持 B |
| R2 可保留的任务学习 | 记忆、策略、模型参数 | 离开原上下文仍有收益 | 专用研究提供 B 级实验支持 |
| R3 研发方法改进 | 算法、训练流程、验证系统 | AI 提案通过隔离评估并进入实际研发 | 个别工作类型被披露;总贡献未量化 |
| R4 跨代研发反馈 | 下一代前沿模型及其研发系统 | 多代可比因果数据、迁移收益、周期缩短 | 公开证据不足 |
| R5 研发起飞 | 智能增长的长期速度 | 加速具有持续性,且不是资源投入解释 | 不能认定已发生 |
R2 可以通过人类设计的循环实现。系统每轮变强,不代表它设计了下一轮学习算法,也不代表所有关键研发决策已经由 AI 承担。局部反复改进、研发自动化、递归改进和研发起飞应分别命名。
2.3 评测、数据与训练框架为何是先进入的环节
本报告判断 D:这些环节有三个适合自动化的性质。
第一,结果更容易转化成可执行工件。测试脚本、数据处理程序、日志诊断、训练配置和性能测试都有相对明确的输入输出。第二,反馈速度通常比新范式研究更快。代码能否运行、吞吐是否改善、故障是否复现,可以较快测量。第三,许多任务可拆分且成本较低,允许并行尝试。
但“容易产生工件”不等于“容易判断正确”。模型可以写出逻辑一致但偏差严重的评测;可以合成大量满足格式但缺少新知识的数据;可以把训练吞吐提高,却降低最终质量或稳定性。
因此,AI for AI 的第一道关键门槛是独立于生成者的评估。评价同一个优化提案,至少需要区分代码运行、训练稳定、预算可比、目标能力改善及其他能力没有明显退化。只通过第一项,会把研发自动化降格为自动生成工作量。
2.4 研发提速的正确分母
研究周期并不只是研究员敲代码的时间。以下分解是分析模型 D:
[ T_{\text{研发}}=T_{\text{问题定义}}+T_{\text{实现}}+T_{\text{排队与实验}}+T_{\text{验证}}+T_{\text{整合与决策}} ]
各项可以部分重叠,公式不用于机械相加估算公司周期。它提醒我们:实现环节很快之后,实验排队、误报审查和发布决策可能成为新的瓶颈。
举例,纯属敏感性演示: 若一个管线有 40% 的可加速工作得到五倍提速,其余环节固定,整体加速上限约为 (1/(0.6+0.4/5)=1.47) 倍。这个数不是 Seed 数据。它说明“编码效率提高五倍”与“模型迭代五倍快”之间存在很大的因果缺口。
也不能只数实验数量。若 Agent 让一天的实验从 20 次增加到 200 次,却没有提高通过严格验证的有价值发现数量,研究系统可能更加拥堵。
更合适的分母是:同等质量、同等总预算条件下,每个被复现并采用的改进需要多少人时、机器时和日历时间。研发起飞要求这些指标共同变化,而不是单项数量膨胀。
2.5 能证明跨代正反馈的证据应长什么样
独立研究提供了一个可借鉴的起点:METR 的 RE-Bench 将人类专家与模型 Agent 放入相同研究工程环境,提供相同资源与信息,再比较不同时间预算下的成果。其 2024 年实验中,短预算与长预算的相对表现不同;研究者同时提醒,真实研发目标更模糊、反馈周期更长。[35] 本报告不把这些旧模型结果当作当前 Seed 的能力结论,而采用其方法纪律:同环境、同资源、人类对照、预算曲线与完整轨迹。
本报告建议用三代或更多模型与研发系统组成的审计序列进行检验 D。三代是提高判别力的研究设计建议,并非 ASI 的定义门槛。
每代固定记录:AI 获得的权限与预算、承担任务的阶段、建议被接受与拒绝的原因、独立复现实验、被实际合入的改进、对下一代研发任务的收益,以及人类新增验证成本。
关键对照是“人类加工具”“固定版本 Agent”“更新版本 Agent”,而不是 AI 使用前后的简单比较。后者会受到团队扩张、更多芯片、不同任务难度、模型配方改变和组织成熟的影响。
真正强的证据是:新一代系统在相同资源下更善于改进研发方法,其成果帮助下一代获得更高研发能力;这个收益能超出原评测分布,并持续抵消验证与实验的新增成本。
当前判断:Seed for Seed 已把研发反馈作为工程方向,但从“帮助研究人员做更多事情”到“持续提高智能增长速度”的公司级转变,仍缺少公开的因果测量。
三、最关键的技术线索:经验怎样从一次任务进入下一次能力
3.1 不同的“学习”不能合并统计
| 机制 | 改变什么 | 经验如何保留 | 主要失效方式 |
|---|---|---|---|
| 上下文内反馈学习 | 当前推理条件与后续行动 | 保留轨迹、观察与反馈 | 清空上下文后收益消失;压缩丢失关键状态 |
| 持久记忆 | 外部可读取状态 | 文件、索引、摘要、任务记录 | 错误记忆、检索失败、跨租户泄露 |
| 小型适配器学习 | 局部可训练参数 | 参数更新 | 任务偏置、漂移、遗忘 |
| 经验蒸馏 | 学生模型权重 | 将有经验条件的决策转为训练信号 | 记住旧任务、经验缺陷被固化、迁移不足 |
| 专用强化学习 | 策略及相关评估组件 | 权重与训练管线 | 奖励投机、分布偏移、局部最优 |
| AI 研发方法创新 | 改进下一代模型的过程 | 算法、训练系统、研发知识 | 研究价值无法验证或无法迁移 |
只有最后一种直接涉及改进“制造智能的方法”;前五种可以提供材料和能力,但连接需要实验验证。本报告不把任何一种排除在超级智能形成机制之外,也不把它们统称为同一件事。
3.2 EdgeBench:重要的新测量,不是 ASI 时钟
EdgeBench 的公开研究覆盖 134 项跨领域任务、约 38,000 小时交互,开放 51 项任务及评测框架;任务允许至少 12 小时运行。作者报告聚合表现随交互时间呈 log-sigmoid 形态,平均拟合 (R^2=0.998)。模型代际学习速度趋势来自一个初始能力相近的 18 任务子集,报告约三个月翻倍。[6][7]
论文明确将主要学习机制解释为上下文学习:Agent 保留观察、诊断和既往尝试,改善下一步决策。它没有通过这些交互直接训练被评测模型的基础权重。[6]
本报告判断 D:这项研究的价值,是把“给 AI 更多时间”拆成有反馈的搜索与经验积累。 过去只看最终分数,可能错过模型学习速度的差异;只看尝试次数,又可能把随机搜索当作学习。
但需要防止五种误读:
- 聚合曲线平滑不代表每个任务都平滑。 真实任务的迟滞、突破和停滞可能被平均掩盖。
- 拟合精度不等于十年预测精度。 在已有任务和时间范围内解释良好,不能证明新环境、更多预算或更强模型仍遵守同一规律。
- 学习速度翻倍不等于研发速度翻倍。 两者的任务分布、预算与结果单位不同。
- 开放子集不等于完整复现。 独立团队还需要访问同等工具、运行协议与反馈,才能判断广泛性。
- 得到任务分数不等于现实组织交付。 客户验收、责任承担、权限冲突和未形式化需求,会改变问题性质。
论文自身讨论强瓶颈、异质任务结构与时间机制可能破坏规律。[6] 因此本报告把它作为新 Scaling 假设 B,而不将其提升为普遍自然定律。
3.3 Chain-of-Experience:更多推理的价值取决于反馈,而非字数
2026 年 8 月的 Chain-of-Experience 研究,将既往尝试与自我或环境反馈保留在推理上下文,考察数学、代码和知识任务。作者报告不同反馈机制的收益与成本差异,并指出较多收益出现在早期迭代。[51]
这里改善的是推理过程,不是基础权重的持续更新。它的重要启示 D 是:推理预算应分配给产生新证据的行动,而非仅让模型写更长的理由。
例如,代码失败信息提供了新约束;另一个模型重复说“请仔细检查”可能几乎没有信息增量。一个判断错误的自评器,会把额外推理导向更自信的错误。反馈的价值取决于它能否区分候选方案,而非是否来自“另一个 Agent”。
在企业任务中,保存原始失败证据、可重放轨迹和数据版本,可能比保存一段漂亮总结更有价值。摘要压缩降低成本,却可能删掉真正影响下一次决策的边界条件。究竟保留多少,应通过下游成功率与复查成本测量。
3.4 Experience Distillation:出现了可跨轮保留的受限实验
2026 年 7 月的联合研究 Sample-Efficient Learning from Agent Experience,提出将试错上下文中获得的决策优势蒸馏进模型权重。研究包含软件工程任务与文字冒险环境,并有清空前轮经验、从更新后的权重开启下一轮的实验。[52]
值得记录的是三个不同结果,而非只看最亮眼的相对增幅:
| 实验问题 | 作者报告的结果 B | 证据能支持什么 |
|---|---|---|
| 上下文收益能否进入权重? | 蒸馏保留至少 64.8% 的 ICL 增益;直接 SFT 对照仅保留 3.8% | 在所测分布中,经验处理方式影响保留效果 |
| 能否迁移到未参与经验收集的 SWE 任务? | 494 项 OOD 任务的 pass@1 从 4.62% 到 8.84% | 有迁移,但绝对成功率仍低 |
| 多轮收益能否积累? | 六个文字冒险任务五轮后平均归一化分数从 7.1 到 47.0 | 受限环境中出现清空上下文后的跨轮积累 |
这些结果比“固定模型在同一道题上重试”强。它们也比宣称通用递归自我改进弱。实验管线由研究人员设计,任务集合有限;文字冒险中的连续轮次不等于前沿基础模型的多代研发,更不等于模型自主改写了自己的学习算法。[52]
本报告对这一证据的判断 D:已经可以认真研究可持续的局部经验闭环;仍不能认定前沿 AI R&D Takeoff。 若把“完全没有持续改进证据”作为立场,会忽视这类实验;若把它当成 ASI 已启动,也会超出证据。
下一步最有区分力的检验是:清空旧经验后跨任务能力是否保留;新领域是否受益;五轮之后边际收益是否继续;训练与教师生成成本是否被计算;旧能力和安全约束是否退化。
经验蒸馏可能有两种长期结果。乐观解释是,每一次高质量交互成为更好的通用策略;保守解释是,每一轮主要固化局部任务知识,收益最终随着任务集合耗尽而饱和。两种解释都与当前受限实验相容。
3.5 TaskMem:记忆不是越多越好
TaskMem 将“记住什么”建模为可学习策略,而非固定摘要。论文在流式视频问答设置中,先训练记忆质量,再利用近期任务反馈更新一个小型适配器;其主干模型保持冻结。论文的任务迁移消融显示,学习到的记忆关注并不自动转移到所有问题类型。[8]
这对持久 Agent 有两个直接启示 D。
首先,用户记忆、研发记忆和组织记忆需要不同的保留规则。研究 Agent 应优先保存失败原因、实验条件和反证;销售 Agent 应保存客户授权、真实需求与关系状态;生活助手则需要明确哪些个人信息应遗忘。
其次,系统可能越使用越熟悉某类需求,同时越不适合另一类任务。这种专门化是价值来源,也是偏置来源。不能用“越用越懂你”推导“越用越具有一般智能”。
因此,季度仪表盘必须分别记录记忆命中、事实准确、任务相关、过期清理与跨任务退化。若只数记忆条目或存储大小,无法判断能力是否增长。
3.6 Agent-R 与 CTRL:错误恢复需要专门学习
Agent-R 使用迭代自训练构造错误恢复轨迹,让模型学习及时修正而非等到任务结束;其实验范围是若干交互环境。[9] CTRL 则训练批评模型,使反馈对固定生成模型的代码纠错更有效。[10]
两项工作的共同研究意义 D 是:生成正确答案和判断如何纠错,是不同能力。一个看似高质量的 critic 可以准确指出错误,却给不出有用修复;也可以改善当前生成者,却对更强或不同风格的生成者无效。
研发 Agent 因此至少需要四种错误分类:信息不足、行动执行失败、目标误解和验证器不可靠。错误分类错了,增加重试会放大故障。例如,权限拒绝不是模型“不够努力”,外部工具反馈冲突也不能用更长思考替代实测。
持续改进机制的核心资产,可能是经过审查的错误数据和可复现验证环境,而不是 Agent 的对话数量。
四、Scaling 已分成多种资源,不能用一个开关解释
4.1 Seed 的证据指向多种扩张方式
2020 年常见的 Scaling 讨论围绕预训练模型规模、数据和训练计算。今天这一部分仍然重要,但 Seed 的公开研究同时涉及交互时间、强化学习、记忆、验证器、沙箱、工具与分布式系统。[3][6][8][11][14][15][16][17]
下表是本报告的机制分解 D,不表示各项已在 Seed2.1 中完成统一部署。
| Scaling 类型 | 真正增加的资源 | 需要观察的收益 | 不能忽视的代价 |
|---|---|---|---|
| Pre-training | 参数、独特数据、训练 FLOPs | 广泛基础能力与学习能力 | 数据质量、通信、硬件与长期训练稳定性 |
| Post-training / RL | 高质量奖励与训练交互 | 可靠行动、纠错和策略改善 | 奖励投机、偏置、回归 |
| Inference-time | 思考、候选与反馈回合 | 相同预算下的质量或可靠性 | 边际收益递减、延迟、重复推理 |
| Context | 可用任务状态 | 保留长依赖和失败历史 | 注意力成本、压缩损失、错误累积 |
| Search / Verifier | 候选覆盖与判断能力 | 更多真正被验证的解 | 验证成本、规格错误、搜索过拟合 |
| Synthetic data | 经验证的训练样本 | 有效经验与能力迁移 | 同质化、污染、错误固化 |
| Agent runtime | 交互时间和环境 | 得到初始推理没有的信息 | 等待、接口变化、权限和状态漂移 |
| Parallel agents | 并行探索与分工 | 独立且互补的候选 | 相关错误、协作成本、验证拥堵 |
| Tool scaling | 可调用资源与环境 | 新任务类型与真实行动 | 工具不稳定、授权、不可逆后果 |
| Compute systems | 有效计算吞吐 | 更快的训练、实验和部署 | HBM、网络、CPU、功率、调度 |
其中最容易误读的是“加更多 Agent”:它增加的是计算与组织结构,不保证增加独立知识。另一种常见误读是“更长 Context”:它允许装入更多状态,但不能确保模型正确使用全部状态。
4.2 verl 与 DAPO:算法和工程必须一起看
verl 官方仓库说明它由 ByteDance Seed 发起、由社区维护,提供灵活的 RL 后训练框架。[14] DAPO 论文开放算法、训练代码和数据处理,强调大规模推理 RL 的若干稳定训练技术;其自报核心实验使用 Qwen2.5-32B 基础模型。[15]
两者支持的是字节参与可复用 RL 工具与方法建设,不是“Seed 所有能力都来自自研基础模型”,也不是“社区项目当前全部成果都应归于字节”。开源框架的贡献具有多方参与和跨模型特征。
本报告判断 D:可复现训练配方具有双重效果。一方面,它降低后训练尝试成本,加快整个生态的实验;另一方面,它让单一算法领先更容易扩散,公司的长期优势需要来自持续发现、工程效率、环境数据和部署反馈。
对 AI for AI,RL 框架还承担“让实验能被准确执行”的功能。模型提出一个奖励或采样改动,框架需要把它变成预算可比的实验;否则自动化只增加不可解释的变量组合。
4.3 预训练并未被 Agent 取代
官方训练数据摘要披露,Seed2.0 Pro 的预训练文本超过 10 万亿 Token、图像超过 10 亿张。这是训练数据规模披露,不是模型参数量。[46]
本报告判断 D:基础能力与环境学习可能互补。 基础模型越能读懂新反馈、提出合理候选,交互可能越有效;环境经验又可暴露预训练数据无法覆盖的工具、私有状态和实际故障。
但不能因此认定每项资源都应无限扩张。大模型可能提高单位交互收益,同时使每次交互更昂贵;小模型加更好的反馈,可能在受限流程中取得更好的成本效果。选择需要比较质量—成本—时延—介入率,而非单一排行榜。
4.4 “新 Scaling Law”需要四类复现
本报告建议 D:对环境学习的 Scaling 至少要求时间外推、任务外推、模型外推与预算外推。只在同一任务中增加时长,无法证明陌生任务也受益;按运行小时对齐,也不代表 Token、工具调用和硬件预算相同。
还应比较两种机会成本:同一个 Agent 多工作十小时,与十个独立候选各工作一小时。前者积累状态,后者扩大探索;哪种更优取决于反馈是否稀缺、任务是否有串行依赖以及经验能否共享。
更长期的 Scaling 上限可能由“发现并验证新经验的速度”决定。旧题、旧反馈与旧工具都被利用之后,新增时间的收益会下降。系统要继续增长,需要进入新的问题空间,并验证其中获得的经验。
这也是为何本报告把有效实验与验证器吞吐放在算力旁边监测。它们不只是部署附件,可能决定计算能否成为能力。
五、从原生 Agent 到复杂系统:中心模型仍然重要
5.1 UI-TARS 是连接模型训练与行动环境的一条实证路线
UI-TARS-2 技术报告描述了原生 GUI Agent 的训练方法,包括数据生成循环、稳定多轮 RL、结合 GUI 与文件系统及终端的环境,以及用于大规模 rollout 的统一沙箱。官方仓库将其发布日期列为 2025 年 9 月 4 日。[11][12]
Seed1.8 的模型卡则强调将搜索、代码执行和 GUI 交互能力纳入通用 Agent 模型,并关注成本和时延条件下的推理控制。[4]
这些研究支持一个重要判断 D:Computer Use 的进步不只是“识别屏幕上的按钮”,还取决于行动后的状态、错误恢复和多轮训练。 静态定位正确,不能保证下一步决策正确;下一步动作成功,也不能保证最后交付正确。
需要区分四个观测量:元素定位、单步操作、完整任务成功、真实流程交付。它们具有不同分母。例如,把表单填好是任务过程;是否写入正确客户记录、是否重复提交、是否保留审计证据,才决定交付是否完成。
5.2 三种竞争解释
| 假设 | 形成能力的主要来源 | 支持线索 | 最强反证方式 |
|---|---|---|---|
| H1 中心模型主导 | 更强模型把感知、推理与行动统一起来 | 原生 Agent 训练、跨能力整合 | 固定模型的系统改进产生更大且广泛的收益 |
| H2 运行系统主导 | 工具、状态、环境、验证与调度提供关键能力 | Harness 与多环境执行;有反馈的长任务学习 | 更强单模型在简单系统中持续超越复杂组合 |
| H3 联合进化 | 模型学会使用更复杂系统,系统为模型提供可学习经验 | UI-TARS、环境学习、经验蒸馏的互补性 | 增加连接后成本失控,经验不能迁移 |
当前本报告采用 H3 作为工作解释 D,置信度中等。 这不是“系统一定先成为 ASI”的结论,而是它能同时解释模型训练与运行工程的公开进展。若未来出现单模型在简单运行环境中大幅超越其他系统,应调整判断。
中心模型和系统不是互斥实体。即使感知、记忆与行动大部分进入一个模型,它仍需要外部输入、资源授权、环境执行与结果验证。反过来,复杂系统无法通过编排把一个始终误解目标的模型无限放大。
5.3 DeerFlow:可以看到系统形态,不能据此看到系统超级智能
DeerFlow 当前官方仓库定位为长任务 Agent Harness,组合子 Agent、记忆、沙箱与可扩展技能,并支持不同模型。它属于字节公开工程生态,不能未经组织披露就认定为 Seed 内部研发系统的完整开源副本。[13]
本报告判断 D:Harness 的价值在于让任务能够延续、隔离、恢复与检查。例如,沙箱保留文件和实验状态,任务管理防止遗漏,轨迹回放帮助定位故障,记忆减少重复工作。
这些改进会提高“系统可工作性”,但能否超越大型人类组织,还需要三个更难的能力:选择值得研究的问题;判断多个结果之间的矛盾;在目标、预算与现实利益冲突时形成可问责的决策。
研究报告、代码、图像和视频都能被生成,不代表它们属于一套协调良好的组织产出。真正的组织能力是这些工件共享正确状态,并能通过外部验收。
5.4 多 Agent 是否必要:应按任务结构回答
外部研究 Towards a Science of Scaling Agent Systems 的 2026 年 4 月修订版,评估 260 种配置与六类基准,强调任务结构和协作架构的匹配;在可拆分金融任务中出现改善,在串行规划任务中则出现明显退化。报告采用修订版,不沿用较早博客的 180 配置口径。[36]
这一证据不能证明 Seed 的特定产品效果,但足以反驳“Agent 更多自然更聪明”的一般假设。
本报告判断 D:多 Agent 至少有四种不同价值:并行探索、能力专业化、独立验证和权限隔离。前三者可能提高质量,第四者主要改善控制。它们不应被统一成“群体智能分数”。
| 任务性质 | 候选组织方式 D | 首要测量 |
|---|---|---|
| 独立资料收集、独立参数试验 | 并行子任务、集中汇总 | 结果互补性与去重后的有效发现 |
| 同一代码状态上的连续修改 | 少量执行者、明确状态所有者 | 冲突、返工、集成失败 |
| 多方案竞争且可便宜验证 | 多候选加独立验证 | 每单位预算通过验证的成果 |
| 单一任务包含不同权限 | 分权角色与受控交接 | 越权、状态泄露、审计完整度 |
| 目标模糊且验收依赖客户 | 人类目标负责人加 Agent | 需求澄清成本与最终验收 |
一个需要反复理解同一状态的任务,拆成过多 Agent 可能降低效率。多个同源模型又可能共同遗漏同一个假设,投票无法修复相关错误。
因此,验证多 Agent 必须固定总计算预算、工具权限和验收标准,并与单 Agent 加更多计算比较。否则“协作提高分数”可能只是资源投入提高分数。
5.5 系统超过组织需要怎样的现实证据
本报告提出一个结果导向定义 D:在多个重要、开放、长期任务中,系统以可接受成本,稳定产出高于优秀人类组织的结果,并能处理失败、冲突与责任边界,才有理由讨论组织层面的超人能力。
应观察的是产品从需求到可靠部署的周期、科研从假设到独立复现的周期、优化从提案到运营收益的周期,而非创建了多少数字员工。
下图展示本报告的假设机制。虚线表示目前尚不能由公开资料证明已形成广泛、稳定的前沿反馈;它不是字节官方架构图。
flowchart TD
M[基础模型] --> A[Agent 与运行环境]
A --> E[实验与真实任务]
E --> V[独立验证与失败诊断]
V --> C[筛选后的经验]
C --> K[记忆与局部策略]
K --> A
C --> T[训练与经验蒸馏]
T --> M
V -.-> R[AI 研发方法改进]
R -.-> T
六、科研自动化:验证容易的领域可能先获得超人优势
6.1 形式数学提供清晰反馈,也提供清晰边界
BFS-Prover 的研究描述模型生成、Lean 环境执行、反馈、训练数据和模型优化的专家迭代循环。[19] Seed-Prover 1.5 则结合 Agentic RL 与测试时推理;作者报告了 PutnamBench、Fate 等评测和 2025 Putnam 题目的形式证明结果。[18]
本报告只把它们当作形式数学的专用系统证据。Lean 能检查形式证明是否在给定公理和陈述下成立,不能自动证明题目翻译忠实、假设合理、研究问题重要,或所有竞赛条件都与人类相同。
本报告判断 D:科学工作中“容易验证的困难问题”,可能比社会工作中“难以定义成功的普通问题”更早被自动化。 数学证明很难生成,但形式正确性可以严格检查;商业谈判的文字更容易生成,但长期关系、真实意图与损益分配难以形式化。
专用超人能力可以成为通用系统的重要模块,也可以长期停留在专用领域。不能只因为数学水平高,就推断其管理组织、识别新科学方向或处理现实伦理冲突的能力同样高。
6.2 Protenix-v2:从计算结果到实验命中的距离
Protenix-v2 公开研究包含生物分子结构预测及设计,报告了特定靶点、预算和实验活动下的命中结果,而不只是一个结构预测榜单。[26]
这比仅输出分子设计图更接近科研闭环,但有必要保留证据分层:结构合理、实验结合、功能有效、可开发性、动物实验及临床疗效不是同一终点。报告不把前端命中率外推成药物成功率,也不把有限靶点集合上的结果当作普遍生物智能。
本报告判断 D:科研自动化的下一瓶颈往往是实验容量与反馈延迟。假设生成速度可以迅速增长,实验样本、检测设备、培养周期及独立复现不会按同一速率增长。
一个更强的模型可能生成更少却更值得实验的候选;一个更大 Agent 团队也可能把实验室淹没在相似候选中。有效科研系统应优化“每个实验预算带来的新知识”,而非“每天提出多少假设”。
6.3 Seed STEM 与 Seed Edge:组织设计是变量,不是能力证明
Seed Edge 官方描述长期研究、跨模态合作、专项算力和较长评价周期,并明确列出记忆、在线学习、软硬件协同与 Agent 等研究主题。[5] Seed STEM 项目面向 100 位研究者发出合作邀请,首期预计约六个月;它是招募与合作计划,不是“已经有 100 位科学家加入”或“已经完成 100 项发现”。[27]
本报告判断 D:这两种组织设计试图降低短期产品指标与长期研究之间的张力。它们可能帮助发现新问题、建立专家反馈,尤其适用于现有网页数据无法提供的科学判断。
但长评价周期既可能保护探索,也可能推迟发现低效研究。足够计算资源既可能扩大实验,也可能弱化预算纪律。应追踪的是可复现成果、专家参与形成的高质量问题与评测,以及成果进入其他研发流程后的贡献。
公开组织意图不能替代公开研究效果。关于内部团队分工、实际人数、奖励制度实施效果,本报告不以招聘文案补全。
6.4 科学“原创性”仍是需要独立检验的问题
AI Research Agents Narrow Scientific Exploration 的 2026 年 7 月修订版研究五类框架与五个模型,生成 219,655 个研究想法,发现它们在所测科学空间中更集中、更接近起始文献,较擅长局部延伸。[37] 本报告使用修订版口径,未沿用较早摘要的样本数。
这不是对 Seed for Seed 的直接审计。它研究的想法分布、历史引用与科学影响代理,也不等于真实实验结果。但它提出一个严肃的竞争解释:研究效率提高,可能主要加快已有路线,而没有同等提高问题选择和原创发现。
本报告判断 D:持续学习最容易先发生在明确目标内。AGI/ASI 的更强主张还需要解释系统怎样选择目标、否定既有路线、找到新的抽象,并让这些发现通过现实检验。
“产生人类从未写过的文字”不能定义原创科学;“首次给出被独立验证的新知识”更接近有效标准。新知识仍需说明重要性、适用范围与可复现性。
七、World Model 与 Robotics:最需要抵抗演示外推的领域
7.1 视频、世界状态与行动策略是不同对象
截至截止日,Seedance 2.5 属于官方列示的视频创作模型;Seed3D 2.0 提供更接近仿真的三维资产、场景与可关节化内容;VideoWorld 研究从未标注视频中学习任务知识。[1][20][22]
本报告区分三种用途 D:
| 用途 | 优化目标 | 验证问题 |
|---|---|---|
| 内容生成 | 美感、可控性、连贯性 | 用户是否满意,编辑是否可用 |
| 世界预测 | 状态转移与反事实准确性 | 改变动作或初始条件后是否仍预测正确 |
| 行动学习与规划 | 任务结果、安全和成本 | 使用预测选择行动后,真实成功率是否提高 |
一个模型可以在第一项十分成功,而第二、第三项仍有限。创作模型合理补全场景,在娱乐产品中是优势;在物理预测中,合理但错误的补全可能成为事故源。
因此,视频视觉质量应与物理预测分开验收。应给出看不见的质量、摩擦、速度、载荷等变量变化,检查模型是否识别不确定性,是否在陌生条件中保持因果一致。
SeedRealtime 的 2026 年 8 月官方说明提供了另一条路线:端到端音视频全双工交互,处理连续观察、说话时机与自然打断。[25] 这与生成离线视频不同,也尚不是物理世界模型的证明。本报告判断 D:实时感知可能缩短观察与行动之间的反馈延迟,让助手在现场工作时获得更多状态;但观察连续不代表因果理解正确,主动回应也不代表已经获得执行现实行动的授权。其长期价值应由持续交互的任务结果、错过事件与隐私边界来验证,而非只看精选对话演示。
7.2 Seed 自己的研究也反对“视频 Scaling 自动学会物理”
How Far is Video Generation from World Model 在可控二维物理环境研究分布内、组合与分布外泛化,报告模型在所测分布外条件中无法可靠抽象普遍物理规律。[21]
这项较早研究不能证明最新 Seedance 必然有同样缺陷,也不能证明所有未来视频模型都失败。它提供的是反证方法:让条件变化可控,评估预测是否服从真实规律,而不是让人类评价画面是否“看起来符合常识”。
本报告判断 D:验证 World Model 的最强证据,应是动作条件下的反事实预测与现实规划收益。跨越这个门槛需要独立任务,不应由创作示例、精选剪辑或模型自评替代。
7.3 VideoWorld 与 Seed3D 解决的是不同环节
VideoWorld 论文在视频围棋与机器人控制任务中探索视觉知识学习,提供了狭义任务验证;其中机器人评估包含 CALVIN、RLBench 等环境。[20] 不能把仿真控制结果写成开放家庭环境的真实机器人成功率。
Seed3D 2.0 的研究则为物体、材质、场景布局和关节交互提供仿真可用内容。[22] 仿真资产可帮助扩大训练分布,但几何与外观正确,不保证材料参数、接触、磨损与传感器噪声都准确。
本报告判断 D:两条路线可能互补。一条提供从视觉中学到的动态知识,一条提供可执行环境的素材。要构成物理学习飞轮,还缺少或需要明确验证的连接包括:动作与观测一致、物理参数标定、真实失败反馈、仿真收益向真实任务迁移。
这些是可能的研究连接,不是本报告确认已经部署的统一训练管线。
7.4 GR-3 与 GR-RL:真实实验比 demo 更重要
GR-3 技术报告描述结合视觉语言数据、机器人轨迹与人类演示的操作模型,并展示 ByteMini 平台上的真实任务评估。[23] GR-RL 在此基础上研究数据筛选、对称增强和真实环境 RL,提高特定穿鞋带任务的操作表现。[24]
GR-RL 主实验报告基线 45.7%,经过筛选和增强达到 72.7%,在线 RL 后评估为 83.3%。论文另有训练曲线一度超过 90% 的描述;本报告采用评估的 83.3%,不把训练移动平均峰值当最终部署成功率。[24]
这里还有两个容易遗漏的条件。其在线流程不只是“约 150 次尝试”:全文说明此前另用离线训练得到的策略采集了 673 条真实环境 rollout,供相关组件适配;“离线策略”不代表采集这些轨迹没有真机成本。论文也保留了轨迹优化等系统环节,并指出在线 RL 行为漂移与把专用收益蒸馏回通用策略仍待解决。[24]
这些事实支持真实反馈可以提高专用高精度操作能力,但不能证明模型已经普遍理解物理世界,也不能证明只需很少交互就能学会任意任务。
7.5 应怎样比较模拟成功率与现实成功率
本报告没有发现能把上述所有系统按同一任务、同一硬件、同一预算连接起来的公开统一数据。因此不提供虚构的“仿真—真实差距百分比”。
有效比较需要如下协议 D:
| 比较维度 | 仿真中固定什么 | 真实环境中记录什么 |
|---|---|---|
| 任务与初始状态 | 相同目标、对象与难度分层 | 初始摆放、对象变化、失败是否计入 |
| 传感与动作 | 时延、噪声、执行器范围 | 标定、误差、实际动作执行 |
| 反馈与干预 | 奖励规则、重置方式 | 人类扶正、重置、保护与维修 |
| 训练预算 | 轨迹数、物理时间、计算 | 真机时间、演示成本、损坏风险 |
| 完成标准 | 完整任务、容许精度 | 质量一致性、耗时、材料损伤 |
| 泛化 | 未见状态与参数 | 新环境、操作者、光照和对象 |
对于企业部署,平均成功率还不够。一天连续运行的尾部故障、恢复时间、是否依赖人工复位,以及失败的经济后果,通常更接近采购决策。
7.6 Digital 与 Physical 的差距是机制差距
本报告判断 D:数字工作可以复制环境、回滚状态、并行试验和快速验证。真实机器人需要物理时间、传感器与执行器,失败会损伤物体或设备,重置往往需要人工。因此两者可能出现数年或更长的部署时间差,但公开证据不足以给出具体年差。
这一判断也需要反证。若高保真仿真、跨硬件通用策略或高效率真机学习出现突破,物理智能可能显著加速。相反,数字工作中权限、验证和客户沟通的瓶颈也可能让数字部署放慢。
应分别记录:数字任务交付率与物理任务交付率,而不是用一张模型能力图为两者确定同一个 ASI 时间表。
八、工业体系:AI R&D 的有效资源不只有 GPU
8.1 训练系统研究提供了比采购传闻更接近使用效果的证据
MegaScale-Omni 论文描述在动态多模态训练负载下解耦并行、重排与负载均衡,称已用于数千 GPU 的内部训练,并报告相对若干系统的吞吐提升范围。[16] Charon 研究则用模拟器预测训练与推理配置表现,支持低成本筛选系统方案。[17]
本报告采用它们证明系统优化方向和作者自报实验,不把最佳配置的倍数提升套到全部训练预算,更不把“部署数千 GPU”扩大为未经核验的十万卡单集群。
分析判断 D:有效计算是硬件、模型、通信和负载共同决定的。 多模态样本长度不均、编码器与语言主干的不同负载、rollout 和训练的资源竞争,都可能使名义规模与可用吞吐差距很大。
这与 AI for AI 有直接关系:若 Agent 能优化配置或找出性能瓶颈,收益可能快速进入下一轮实验;但若只通过微基准,其改善未必在生产负载中保留。
8.2 CapEx、融资与可用算力不能互换
Reuters 2025 年 12 月转述 FT 的 2026 年约 1,600 亿元 AI 基础设施初步投资计划,并明确未能即时独立核实。[39] 2026 年 9 月 Reuters 报道一项 296 亿美元贷款安排,消息人士称主要支持 AI 相关计划,而企业用途口径为一般公司用途。[43]
本报告不将两者相加。贷款是融资工具,CapEx 是投资或采购口径;同一项目可能使用该融资。计划、签署、支付、交付与投产又是不同阶段。
判断 Seed 的资源约束,需要看已经供研发使用的训练小时、实验排队、推理配额和环境容量。即使资金充足,HBM、网络、机架、冷却、并网与软件迁移仍可能限制可用资源。
公司不是上市审计财报意义上的透明样本。外部不能可靠分拆 Seed、云客户、消费产品和其他业务的全部成本。报告因此不估算“字节每个模型花了多少钱”或“每个研究员拥有多少 GPU”。
8.3 芯片报道必须保留冲突
| 公开消息 | 来源状态 C | 本报告采用的结论 |
|---|---|---|
| 2026-02:SeedChip 与 Samsung 制造谈判报道 | 匿名消息;字节发言人称相关自研芯片消息不准确 | 存在报道与官方否认;不能确认计划或产量已实现 [40] |
| 2026-05:定制 CPU,Arm / RISC-V 方向 | Reuters 引述消息人士;项目处早期 | CPU 路线的报道,不是自研训练 GPU 已量产 [41] |
| 2026-05:Qualcomm ASIC 合作 | Reuters 转述 Bloomberg,未独立核实 | 作为潜在供应路线,不能当现成可用算力 [42] |
| 2026-06:与天数智芯等讨论推理芯片采购 | Reuters 消息人士;谈判未最终确认 | 供应多元化的报道,不等于已交付采购 [44] |
这些材料有不同项目、用途和披露状态,不能通过“取平均”消除冲突。一个早期项目被否认,也不证明公司永远不做芯片;另一个项目被报道,也不证明被否认项目已经成立。
本报告判断 D:Agent 规模化会增加 CPU、内存、存储与环境调度负载。每个 Agent 不仅生成 Token,也运行测试、维护文件、操作浏览器和等待外部反馈。自研或多元供应的经济价值,可能来自降低整个任务运行成本,而非单颗芯片的最大 FLOPs。
8.4 电力问题具有地点和时间属性
IEA Electricity 2026 把数据中心列为未来电力增长的重要驱动,并强调电网与灵活性需求。[38] 这是行业背景,不能由此算出 ByteDance 的耗电量。
本报告判断 D:训练集群需要稳定供电与网络;实时助手需要靠近用户的低延迟服务;后台研究任务可以在一定程度上接受时间或地域调度。三种工作负载的选址和电力弹性不同。
廉价发电不等于可用数据中心。并网容量、建设时间、冷却条件、芯片可获得性、跨区域通信及运营规则共同决定项目能否投入使用。
持续 Agent 的资源账还需要把空闲等待计算清楚:一天在线不代表一天满载 GPU。若能将推理、实验与后台状态有效拆分,系统可以节约资源;若每个任务长期占用完整环境,成本会随并发数急剧增加。
8.5 工业约束也可能改变技术路线
本报告提出三条条件推断 D,而非既成事实:
- 若最先进训练硬件受限,工程效率与任务专用后训练的相对价值可能上升。
- 若推理需求远快于训练需求增长,模型路由、缓存、小模型和专用加速可能影响商业竞争。
- 若实验资源稀缺,更好的候选筛选和经验蒸馏可能比单纯更多 rollout 更有吸引力。
但约束不会自动制造突破。软硬件协同和模型压缩可以改善效率,也可能增加兼容性和研发复杂度。应追踪完成同样任务的总成本,而不是假定限制必然催生更优技术范式。
九、产品与生态:流量什么时候能成为学习优势
9.1 多个产品入口不能直接组成一个数据飞轮
Seed 官网呈现面向应用与企业服务的模型渠道。[1] 扣子、TRAE 和开源 Harness 等又分别提供工作空间、工具执行和开发功能。[13][28][31]
本报告判断 D:这些入口可以降低获客、部署和观察真实问题的成本。但形成研究优势至少需要完成下面四次转换:
使用事件 → 可诊断反馈 → 获准使用且有质量的经验 → 进入训练后在陌生任务上有收益。
第一步会筛掉大量无明确结果的对话;第二步需要识别是模型错误、需求不清还是工具故障;第三步涉及数据授权、敏感信息与去重;第四步则需要训练和独立验证。每一步都有损耗。
假设模型每天处理更多 Token,并不能说明有更多新信息。长 Context、视频编码、内部应用、重复推理、价格补贴与模型路由都会改变调用量。没有统一口径,跨公司 Token 数比较尤其容易误导。
因此本报告没有将网上流传的巨额日调用量、未经查明作者与统计口径的文章数字写入领先指标基线。公司官网上的技术说明、正式文档与平台文章不能只因同域名就获得相同证据权重。
9.2 扣子的当前形态:协作与持久运行,同时有产品迁移
截止日可访问的扣子 FAQ 描述 3.0 中的多人、多 Agent 项目、独立上下文、文件与产物保留、本地和云端 Agent 接入等功能。文档同时明确,某些名为 Codex CLI 或 Claude Code 的云端 Agent 使用的是平台模型或开源框架,并不直接等于对应厂商官方产品或用户原有账户。[28]
这说明字节在产品层探索 Agent 组织与长期工作空间,但不能证明这些组织已经产生超过人类团队的 collective intelligence。
产品边界需要按具体服务核验:
| 功能变化 | 当前一手文档 B | 正确解读 |
|---|---|---|
| 扣子中的新编程项目入口 | 自 2026-09-08 不再新建该类项目;改用 Agent 调用编程与部署插件,已有项目不受影响 | 工作入口迁移,不等于所有编程能力取消 [29] |
| 扣子编程 OpenClaw 项目 | 自 2026-06-30 不再新建旧项目;存量继续;提供扣子 3.0 云端 Agent 替代方式 | 高运维成本推动产品形态调整,不等于 OpenClaw 整体下线 [30] |
| 本地 Agent 与云端 Agent | 访问范围由具体接入方式决定 | 云端隔离承诺不能套用到主动授权本地设备的模式 [28] |
本报告判断 D:这种调整是持久 Agent 的现实经济信号。产品方需要在环境资源、协作、运维与交互成本之间取舍。不能只按发布时的“永远在线”宣传判断当前服务,也不能把入口整合自动解释为研发失败。
9.3 TRAE / SOLO:代码逐步成为工作流中的一个阶段
TRAE 的 2026 年 3 月官方说明,将新版 SOLO 描述为共享项目工作空间的 Code 和工作任务模式,包含文档、分析、报告等产出,并区分桌面与云端使用。该公告当时为分地区、分阶段 beta;本报告不据此声称截止日所有地区已经同等开放。[31]
分析判断 D:一个编程 Agent 一旦能够读取需求、分析数据、创建交付文件和运行代码,其商业边界会从“代码编辑器”扩展到项目推进。但扩展产品范围,不等于每项专业工作都已达到专家质量。
对于企业,关键评估不是“它可生成多少格式”,而是资料是否被正确使用、结果是否可以复查、前后阶段是否共享正确状态,以及是否减少整合劳动。
9.4 开源扩散是一种路线,不能简化为所有权开放
Seed-OSS 官方仓库提供 36B 模型及不同预训练数据版本,并说明开放许可和长上下文、推理预算等设计。[32] coze-studio 提供开源的 Agent 开发平台。[33] verl、TARS 与 DeerFlow 又分别开放不同训练或运行组件。[12][13][14]
这些对象的开放范围不同:模型权重、训练数据、完整配方、执行框架、云服务和产品账户,应分别核验。开源平台不能自动获得云端商业版的全部能力;某个开放模型也不能自动继承最新闭源前沿模型的能力。
本报告判断 D:开源可以扩大工程采用、降低组合成本、形成事实接口与研究基线。但它未必使企业掌握数据、执行身份、服务渠道和最终分发。开放技术与集中控制可以同时存在。
对中国生态,更重要的观察是不同模型和系统能否互操作,以及企业能否携带工作流、数据与评测迁移。用闭源或开源二分法评价整家公司,会遮蔽这些实际边界。
9.5 内容平台与用户 Agent:目标函数可能冲突
本报告讨论的是结构性可能 D,不声称某一产品目前秘密操纵用户。
内容平台通常需要决定用户看到什么;用户 Agent 则需要代表用户决定应看什么、买什么或忽略什么。如果一个 Agent 的最佳行动是减少用户停留、拒绝广告推荐、选择平台外更便宜的商品,平台商业收益与用户目标可能发生冲突。
Agent 权限扩大之后,这种冲突不再只是“推荐是否公正”,还可能涉及行动:订单、退款、订阅和内容发布。真正的用户代理关系需要回答:当用户利益与平台收益不同,系统以谁的目标为准?
可验证的产品标准包括:商业关系披露、可配置目标、平台外选项、决策理由、行动日志、可撤销权限、数据导出与迁移能力。不能仅用“个性化”或“懂你”判断归属。
9.6 跨平台 Agent 的瓶颈可能是授权与商业接受
Reuters 报道 2025 年 12 月豆包语音助手与 ZTE 手机合作;随后有来源的报道记录了其他应用限制功能、字节调整能力的情况。[49][50]
这些事件只证明当时存在入口与平台限制,不代表截止日每个 App 仍执行相同措施,也不证明全部限制都出于商业防御。安全、隐私、接口规范和平台利益可能同时存在。
本报告判断 D:跨 App 智能不只取决于“能看懂屏幕”。支付确认、身份认证、反自动化和服务条款决定系统能调用哪些资源。技术成功率与获得合法、稳定行动权应分开监测。
生态内闭环较容易建立,也更可能形成供应商锁定。生态外工作更有用户价值,却需要清晰授权和协作协议。这个张力可能决定 Agent 平台的商业边界。
十、Control:反馈越强,越需要独立于反馈的边界
10.1 已公开什么,尚未验证什么
Seed 官网设有 Transparency 页面,提供部分模型训练内容摘要。[45][46] Responsible AI 招聘材料说明团队研究可靠、安全与可信 AI,并参与产品安全与伦理工作。[47] TARS 仓库也公开幻觉、资源消耗和潜在滥用等限制。[12]
这些是实质披露,但性质各异。数据透明摘要不能替代 Agent 行动风险评估;招聘不能证明特定风险已被解决;列出限制也不等于已经建立了对所有风险有效的控制机制。
在本次查阅范围内,报告没有找到足以逐项核验 Seed 全部前沿模型的统一公开危险能力门槛、触发后的部署动作与独立审计结果。因此相关指标记为“公开证据不足”,不记为“无安全工作”或“安全风险低”。
10.2 按 Agent 的权限,定义控制对象
下表是本报告建议 D,而非 Seed 产品当前全量保障清单。
| 能力增长 | 对应风险 | 控制应验证什么 |
|---|---|---|
| 长任务与持久记忆 | 错误状态长期累积 | 状态版本、来源、过期和删除是否生效 |
| 浏览与工具调用 | 外部指令污染目标 | 不可信内容能否改变授权和任务范围 |
| 多 Agent 协作 | 权限合并、相关错误 | 角色隔离、任务交接、共享文件边界 |
| 训练与数据生成 | 偏差进入下一轮权重 | 数据审查、隔离评测、可追溯版本 |
| AI R&D 资源调用 | 预算失控、危险实验 | 资源配额、实验白名单和停止路径 |
| Computer Use 与支付 | 重复执行、错误身份 | 幂等、确认、撤销和审计 |
| 机器人执行 | 人身、物体与设备损伤 | 物理限位、急停、故障恢复和现场监督 |
判断标准不是系统是否愿意说“我遵守规则”,而是它在模糊、冲突和诱导情境中是否保持边界。能力越强,控制测试越应覆盖替代行动路径,防止系统用未受约束的工具实现同一结果。
10.3 Harness-IF 的意义:成功与服从应分别验收
Seed 公开论文目录列出 2026 年 8 月 Harness-IF,摘要提出在多个指令载体上通过执行证据评估操作规则,并区分真正遵从与模型本来就会这样做的情况。[53][54]
本报告可访问摘要,但完整正文获取受限,因此不引用未经细读的分项百分比,也不据此评价 Seed2.1 的具体控制水平。
方法启示 D 是明确的:如果要求“不改动某个文件”,而 Agent 恰好不需要那个文件,成功完成任务并不能证明它尊重该约束。更有力的测试需要让遵守规则与默认高分策略发生真实冲突。
AI R&D 中尤其需要这一做法。若禁止修改测试集,系统必须在修改测试可以提高分数时仍然拒绝;若限制实验预算,必须在增加预算可能获得更好结果时仍然遵守。只在没有诱因的场景测试规则,容易高估控制。
10.4 奖励闭环与安全闭环可能分离
本报告判断 D:任务分数提升并不保证控制提升。模型可能更善于满足一个奖励,而同时更善于找出评分与真实目标的差异。
TaskMem 论文讨论了奖励被简短、缺少实质内容的输出利用,需要增加记忆丰富度等设计。[8] 这是一项受限训练中的奖励问题,不是对真实产品恶意行为的指控,却说明“有自动评分”不等于“评分足够”。
控制设计应独立于任务奖励,包括未经授权不能跨越的权限边界、保留原始证据、审计不由执行者自行决定、停止系统时能够回收凭据与子任务。
一个 Agent 进程被终止后,若后台任务、外部 API 凭据或云端子 Agent 仍可继续操作,就不能算完整中止。控制对象是行动系统,而不只是一个对话窗口。
10.5 数据回流与客户信任存在明确边界
火山方舟相关官方文档的可检索内容说明,在相应图片和视频理解服务中,不保留用户提交内容用于模型训练。[48] 这是具体服务文档范围内的说明,本次正文抓取受限;报告不把它扩大为所有字节产品统一的数据承诺。
分析判断 D:应用规模可能产生产品反馈,却不能假定所有客户原始内容都可直接进入训练。企业若主动授权回流,也需要确定哪些字段、哪些用途和哪些派生数据被包含。
数据治理不是研发飞轮之外的阻碍,而是使高质量反馈能被持续使用的前提。如果客户因无法控制数据而不愿把重要任务交给 Agent,系统得到的反馈将停留在低价值和低敏感度场景。
十一、竞争解释与反证:避免把一切进展拼成必然起飞
11.1 四种解释都能解释部分现有事实
| 解释 | 如何解释 Seed 的公开进展 | 哪个观测最有区分力 |
|---|---|---|
| E1 产品与工程追赶 | 通过评测、RL、成本优化和渠道,快速改善可用性 | 收益是否主要集中在现有产品任务 |
| E2 环境学习范式扩展 | 利用有反馈任务与经验蒸馏,提高学习效率 | 跨任务、跨分布、跨轮保留是否持续 |
| E3 AI R&D 正反馈 | AI 开始改善制造下一代 AI 的方法 | 固定资源下,连续代际研发能力与周期的因果变化 |
| E4 工业规模优势 | 资金、集群、部署与组织资源带来竞争力 | 扣除资源增长后,单位有效资源产出是否提高 |
本报告当前认为 E1、E2 与 E4 有较强的公开线索;E3 已有局部工程方向,公司的持续前沿反馈仍未验证。它们不是互斥情景,也不能用“看上去符合起飞”把其余解释排除。
11.2 需要主动挑战的八项叙事
- “任务跨几十天,所以已有几十天自主研发能力。” 必须澄清干预、等待、状态维护与验收。跨度不是 Horizon。
- “经验写入权重,所以已出现通用 RSI。” 任务专用训练与自主改善研发方法不同;跨轮收益也不自动跨领域。
- “拟合出 Scaling Law,所以能力可按指数预测。” 拟合、外推与因果机制需要分别检验。
- “多 Agent 的组织形态就是集体超级智能。” 存在角色与消息不是证据;应测协调之后的净产出。
- “视频看起来真实,所以模型理解物理。” 反事实、分布外与真实控制实验才有判别力。
- “用户越多,训练数据越好。” 用户量不提供自动授权,也不提供可靠奖励。
- “采购或自研芯片规划代表算力瓶颈解决。” 计划、交付、软件适配与有效吞吐应逐项验证。
- “没有公开统一安全框架,所以没有做安全。” 信息缺口不能直接推定内部事实;同样不能据此假定控制成熟。
11.3 最可能使本报告核心判断失效的证据
本报告以反馈转化为持久能力作为关键机制。至少四种证据会迫使我们下调其解释力 D:
- 独立复现发现,经验蒸馏大部分收益来自同题或相近任务记忆,严格新分布迁移没有净收益。
- 增加反馈与持久状态后,错误污染和遗忘造成的损失超过新任务收益。
- 前沿研发中,AI 生成成果的独立验证成本持续高于人类直接完成成本。
- 极强中心模型通过简单推理即可普遍完成复杂任务,使大部分外部经验和运行工程的增量价值明显下降。
也有三类证据会提高置信度:多个独立团队复现跨轮保留;陌生工具和研究问题上的迁移;固定总资源下连续前沿研发周期缩短且质量保持。
“尚未证明研发起飞”不是押注它不会发生。研究纪律要求:当强证据出现,及时上调判断;在强证据出现之前,不把可行方向写成已实现状态。
十二、未来 3—10 年情景:用转折点替代 ASI 年份
以下是 D 类条件情景,观察窗口约为 2029—2036 年,不是事件发生年份预测。本报告不赋予数值概率:现有公开资料不足以校准这些概率。
情景 A:持续 Scaling 与 Agent 改进,没有明确 AGI 日
前提: 预训练、后训练和运行工程仍有收益;经验学习进步,但没有形成显著加速的研发方法反馈。
领先指标: 固定任务集的验收率提高;人工接管减少;单位有效任务成本下降;更多业务流程可在清晰边界下交付。
可能结果: 字节依托产品入口和模型渠道扩大实用 Agent 市场。企业感受到的是工作分工改变,不是某一天突然跨过智能阈值。
风险: 工作流改进与市场宣传脱节;产品整合增加锁定;流量增长无法覆盖持久运行成本。
上调证据: 多季度出现质量、成本、介入率的共同改善。下调证据: 更大预算只能维持同等质量,或真实流程失败率长期高于基准。
情景 B:AI R&D 出现显著正反馈与 Takeoff
前提: Agent 不只实施方案,还能提出、验证并推广研发方法;收益进入下一代,且验证、算力和实验环境跟得上。
领先指标: 被采用的 AI 原创研发提案增加;同等预算下研发周期缩短;新模型更擅长改进训练与研究;跨代收益有可追溯数据。
可能结果: 研究竞争从单次模型发布转向研发系统效率。具有训练系统、验证环境和经验资产的公司获得更大累积优势。
风险: 自动评测被利用;隐藏故障进入训练;监督负担增长;能力与部署控制不同步。
上调证据: 至少多代可比因果序列、独立复现和资源归一化结果。下调证据: 收益停留在软件实现,新增质量完全由更多预算或人类研究解释。
情景 C:Compute、Energy、验证或 Control 成为主要瓶颈
前提: 模型能提出更多行动,但工业资源、现实验证、权限或监督不能按同一速度扩张。
领先指标: 实验排队增加;推理配额和产品形态调整;单位交付成本不降;验证团队成为主要人力负担;平台限制影响可执行任务。
可能结果: 技术路线转向更小模型、专用策略、路由、批处理与更强资源纪律。部署速度低于模型测评进度。
风险: 降价与补贴掩盖真实成本;为降低摩擦而过度放宽权限;供应集中使企业工作流脆弱。
上调证据: 已交付资源不足、长期排队或监督成本持续增长。下调证据: 软件效率、供应多元化和可控运行明显改善单位交付成本。
情景 D:新技术范式降低经验学习或预训练的关键成本
前提: 持续学习、架构、扩散语言模型、世界建模、软硬件协同或其他方向,产生超出当前配方的广泛收益。列举方向不表示 Seed 已实现某一突破。
领先指标: 固定计算下新分布能力提升;参数更新不明显遗忘;极少反馈就能稳定学会陌生任务;独立团队复现。
可能结果: 当前按参数、Token 或 Agent 数衡量的竞争被重新定义。Seed Edge 等长期研究机制可能受益,也可能由其他公司首先突破。
风险: 精选任务与最佳配置掩盖泛化不足;新架构引入难以审计的状态与控制问题。
上调证据: 跨任务、跨模型、跨团队结果与清晰机制。下调证据: 仅在一类基准有效,工程整合之后优势消失。
情景 E:商业分发成功,但通用研究停滞
前提: 消费、创作和企业产品持续改善,收益却主要来自产品化和现有能力组合。
领先指标: 用户和收入增长,但环境学习迁移、原创研究与跨代研发能力没有同步改善。
可能结果: 字节成为强大的 AI 应用与工业平台,同时无法证明通用超级智能的形成。这是完全可能且商业上有价值的结果。
风险: 分发与研究的成功被混用,资本配置被无法证伪的 AGI 叙事牵引。
上调证据: 产品指标与研究指标长期脱钩。下调证据: 产品失败数据明确转化为可迁移的研发与基础能力收益。
情景之间如何转移
本报告建议按瓶颈变化判断,而非按模型名称判断。若 A 中的工作流收益进入研发方法,并在多个代际中保留,则转向 B;若能力提高而有效实验和控制停滞,则向 C 移动;若新的机制改变学习效率并被广泛复现,则提高 D 的权重;若只有商业扩张而没有研究机制进步,则提高 E 的权重。
一个季度可以同时存在多个方向。例如数字产品进入 A,某个局部研发模块呈现 B 的先兆,机器人仍受 C 限制。不能给整家公司贴上单一“起飞”标签。
十三、季度领先指标仪表盘:监测能力形成,不追问 AGI 是否到了
13.1 指标设计原则
仪表盘是本报告提出的可更新框架 D;下表“基线”只表示目前证据状态。没有公司公开数据的指标明确写未知,不用实验室总体趋势代填。
每次更新同时保存模型版本、运行系统版本、工具、总预算、成功定义、失败记录、人类介入与数据来源。若任一条件改变,先报告口径变化,再比较趋势。
| 编号 | 指标 | 建议定义与分母 | 2026-10-06 基线 | 更新频率 / 触发证据 |
|---|---|---|---|---|
| 01 | 跨领域能力 | 固定任务组、逐领域结果,不只总分 | 官方评测丰富;第三方可比性不完整 [2][3] | 季度;新模型加独立复测 |
| 02 | 人类任务 Horizon | 人类完成时长对应的 50% / 80% AI 成功阈值 | 未核验到 Seed 可用的同口径完整估计;不得以任务跨度代替 [34] | 有新独立测量即更新 |
| 03 | 完整 Agent 验收率 | 所有启动任务中最终验收通过比例 | 缺统一真实业务样本 | 月度内部、季度汇总 |
| 04 | 人类介入 | 每任务介入次数、人时、原因 | Seed for Seed 未统一披露 | 按难度、成功失败分别记 |
| 05 | 失败恢复 | 注入故障后完成率与新增成本 | 有专用恢复研究 [9][11][24] | 固定故障集季度复测 |
| 06 | 运行中学习收益 | 同预算、有反馈相对无反馈的改善 | EdgeBench / CoE 提供研究协议 [6][51] | 固定任务、固定预算复现 |
| 07 | 上下文清空后保留 | 清空经验后的增益 / 保留经验的增益 | Experience Distillation 有受限实验 [52] | 每轮学习后测量 |
| 08 | 跨任务迁移 | 未参与经验收集的任务上的净收益 | 有 OOD SWE 实验;广泛领域未知 [52] | 季度扩大盲测范围 |
| 09 | 持续轮次的边际收益 | 每轮单位成本的新能力增量 | 有有限多轮实验,长期斜率未知 [52] | 多轮连续序列 |
| 10 | 记忆质量 | 准确、相关、过期删除、污染与退化 | TaskMem 提供研究起点 [8] | 月度;模型/记忆策略更新 |
| 11 | AI R&D 工作覆盖 | 按评测、数据、训练、算法、Infra 分阶段记录 | 官方称覆盖多环节;占比未知 [2] | 季度审计任务记录 |
| 12 | AI 提案采用率 | 独立验证并被合入的提案 / 全部候选 | 公司级数据未知 | 同时记录拒绝原因 |
| 13 | 研发周期 | 同质量目标下从定义到可部署版本的日历时间 | 可比公司序列未知 | 每代;归一化人员与算力 |
| 14 | 跨代研发反馈 | 下一代研发能力中可归因于前代 AI 成果的增量 | 未验证 | 多代追踪,独立审计 |
| 15 | 新知识 | 被外部复现的新发现 / 全部候选 | 专用科研自报结果;通用序列不足 [18][26] | 半年;分级终点 |
| 16 | 多 Agent 净收益 | 固定总预算、权限下相对单 Agent 的提升 | 有产品组织形态,缺统一 Seed 效果 [28][36] | 季度架构对照 |
| 17 | 有效并发 | 单位时间验收产出、尾部时延和冲突 | 未公开可比整体数据 | 月度运行数据 |
| 18 | Verifier 吞吐与质量 | 通过独立复查的结果 / 验证资源 | 数学反馈较明确;通用研发未知 [18][19] | 季度;审查误判 |
| 19 | World Model 实用收益 | 用预测规划相对不用预测的真实任务收益 | 有局部研究,广泛现实连接未验证 [20][21][22] | 跨分布、跨环境评测 |
| 20 | 真实机器人交付 | 完整任务成功、耗时、干预、损伤与恢复 | GR 系列有局部真实实验 [23][24] | 同任务、同硬件复测 |
| 21 | 已交付有效 Compute | 可用训练/实验吞吐与排队,非承诺金额 | 有系统论文;完整集群资源未知 [16][17] | 季度,交付与投产分别记 |
| 22 | 单位验收任务成本 | 推理、工具、环境、验证和运维总成本 | 不宜用 Token 单价代替 | 月度、模型切换前后 |
| 23 | 可用电力与工业延迟 | 实际可用容量、并网与交付日期 | 公司级完整基线未知 | 项目投产时更新 |
| 24 | Control 与归属 | 越权、注入、停止、日志、导出与迁移的测试结果 | 部分披露;统一可比结果不足 [12][45][47][53] | 每次权限或运行系统变更 |
13.2 不建议汇总成一个“ASI 指数”
不同指标不能轻易线性相加。模型能力提高不能抵消越权事故,低价不能抵消错误交付,大量并发不能抵消验证失败。一个综合分会遮蔽决定下一阶段的瓶颈。
更实用的季度结论是:哪三项进步得到强证据,哪两项成为瓶颈,哪些未知已经缩小,哪些判断需要撤回。
可采用证据状态而非宣传色彩:已独立复现、公司自报有实验、仅功能披露、证据缺失、出现反证。 同一指标可同时有自报进步与独立反证,二者都应保留。
13.3 最优先跟踪的五项
对判断“Seed 是否进入智能增长反馈”,本报告优先选择:AI 提案独立采用率、研发周期、清空上下文后的保留、跨任务迁移、多轮收益的边际成本。
这五项能区分“生成更多成果”“工作流更顺畅”和“系统持续提高制造智能的能力”。GPU 规模、流量与模型榜单作为解释变量记录,不替代这五项。
十四、对企业、OPC 与个人的意义
本节为 D 类建议,针对工作机制而非即时产品购买推荐;具体产品可用性、价格、数据条款与授权需在实施时再核验。
14.1 企业应购买可验收能力,而非“数字员工人数”
Seed 生态最值得企业试验的任务,是资料输入明确、工具范围明确、结果可验收、失败可回滚的流程。任务是否“看起来高级”并不重要。销售复盘、数据清洗、报告初稿、代码维护和内部检索,都可能产生价值,但质量标准要由真实业务决定。
一个流程的价值可按以下方式核算:节省的人时和新增收益,减去复查、返工、错误损失、系统集成与维护成本。不能只用 AI 输出所需时间替代原流程成本。
尤其要检查最后一公里:报告形成后谁决策,订单创建后谁确认,代码运行后谁维护。若这些环节没有负责人,自动化会把问题转移给后续团队。
14.2 OPC 的优势可能来自可验证的小系统
一个人协调多个 Agent,并不自动拥有一家大公司的能力。OPC 最有机会的领域,是自己掌握业务判断、客户沟通和验收标准,同时让 Agent 承担可定义的工作段。
核心资产包括客户特定流程、数据结构、工具连接、失败经验和质量检查。通用提示词容易复制;经过真实业务验证的任务环境和验收协议更难复制。
本报告建议从一个有清晰结果的流程开始,保留失败案例与人工接管原因,然后决定需要改模型、改工具还是改任务定义。不要把所有失败都归于模型能力不足,也不要过早堆叠 Agent。
14.3 企业 AI 顾问的工作重心会变化
研究型模型和更成熟 Harness 会降低原型创建成本。顾问更应承担需求澄清、数据权限、工具集成、验收设计、异常处理和持续运营。
这与“只交付一个聊天机器人”不同:一个业务流程通常包含不同角色、不同权限和不同完成标准。顾问需要判断哪些阶段可以自动执行,哪些需要人类判断,哪些应改造原流程。
本报告建议将交付物定义为四件事:可运行流程、验收数据、权限与操作说明、维护及回滚方式。模型名称只占其中一部分。
14.4 个人应保留自己的长期工作资产
持久 Agent 能降低重复解释成本,同时可能让工作状态依赖某个平台。个人应关注文件可导出、任务记录可携带、技能可迁移与权限可撤销。
“代表我工作”应表现为可以检查行动、理解它使用了哪些资料,并决定哪些目标和资源继续授权。一个总能给出令人满意解释、却不能让人复查结果的 Agent,不足以成为可靠代理。
14.5 一个可执行的八周验证流程
以下是组织试点建议 D,不是 Seed 产品性能保证。
| 时间 | 任务 | 应得到的证据 |
|---|---|---|
| 第 1—2 周 | 选择一个高频流程,定义真实完成标准,采集历史任务 | 人类基线、失败成本与权限边界 |
| 第 3—4 周 | 用固定版本模型与运行系统回放任务 | 全部成功失败、介入人时和总成本 |
| 第 5—6 周 | 仅改一个关键变量:反馈、记忆、工具或模型 | 可归因的质量变化与反例 |
| 第 7—8 周 | 在新任务上盲测,测试停止、回滚与迁移 | 能否扩大使用的依据 |
试点不需要先判断 AGI 是否到来。只要流程有净收益并保持可控,就值得继续;若没有,则用失败数据定位瓶颈,而不是用更宏大的技术愿景解释。
十五、关键未知与最终判断
15.1 目前不知道的十件事
- Seed 全部研发工作中,AI 的实际覆盖、人时替代与质量贡献各是多少。
- 官方描述的长跨度任务包含多少干预、等待和工程维持。
- AI 提出的算法或研究方案中,多少通过独立验证并进入前沿训练。
- Seed for Seed 是否已经连续影响多代前沿模型,以及净加速幅度。
- 经验蒸馏在更广领域、更长轮次和更强模型上的迁移与遗忘表现。
- 多 Agent 相对同预算单 Agent 的长期净收益,以及可控并发规模。
- 最新闭源模型的完整训练计算、参数结构和全部关键配方。
- Seed 可用资源在训练、推理、研发 Agent 与产品之间如何分配。
- 全部前沿能力风险门槛、部署触发动作及独立 Control 评估结果。
- 世界模型、机器人、科研和通用 Agent 是否已在内部形成统一学习系统。
这些问题均不能用公司愿景、匿名参数传闻、招聘岗位或视频展示填补。
15.2 本报告采用的最终判断
ByteDance Seed 已经成为研究 AI 如何从使用经验中持续改善的一个重要对象。 支持这一判断的证据不是一个最高分模型,而是覆盖环境学习、参数保留、错误恢复、专用验证、训练系统和官方研发使用的多条公开线索。[2][6][8][9][14][18][24][51][52]
本报告进一步判断 D:它可能具备把研究、应用与工业资源连接起来的条件;真正的竞争优势取决于这些连接是否产生经过验证、可保留、可迁移的收益,而非每个环节单独扩张。
目前能够成立的是:官方披露的研发闭环,以及受限实验中的多轮能力积累。尚不能成立的是:前沿通用智能已经出现持续递归研发起飞,或整个系统已超过大型人类组织。
未来最值得盯住的转折点,是每单位资源产生的已验证新知识与研发改进是否持续提高,且下一代系统比上一代更善于获得这种改进。若出现这样的序列,超级智能形成机制就会从可能连接变成可观察事实;若没有,产品和工程成就仍有价值,但应按其真实范围评价。
十六、来源目录与核验说明
所有来源于 2026-10-06 核验。动态页面日期记为“截止日快照”;论文同时记录首次公开日期或所用修订版。下面列出的页面用于支持正文相邻的具体论述,不代表已核验站内所有内容。无全文访问的材料注明范围,不用摘要推断内部细节。
官方模型、研究与工程资料 B
- [1] ByteDance Seed,官网,截止日快照。 首页。支持团队公开定位与官网列示模型,不能证明统一内部架构或全部产品部署状态。
- [2] Seed2.1 Officially Released: Advancing AI Productivity,2026-06-23。 官方说明。Seed for Seed、Agent 与研发使用为官方披露;未独立验证公司级研发加速。
- [3] Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity,2026-06-30。 arXiv 2607.00248。作者为 ByteDance Seed;自报评测不自动升级为 A。
- [4] Seed1.8 Model Card: Towards Generalized Real-World Agency,2026-03-21。 arXiv 2603.20633。论文日期不应被误作所有产品首次发布日期。
- [5] Seed Edge,截止日快照。 长期研究项目。研究主题、评价周期与资源安排属于公开组织设计。
- [6] EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments,arXiv v1,2026-07-06。 论文;已读 PDF。原文日期另列 July 7;聚合拟合及代际趋势均为作者报告。
- [7] EdgeBench: Measuring Real-World Environment Learning and Discovering a New Scaling Law,2026-07-07。 官方技术说明。与 [6] 属于同一研究证据链,不算独立交叉验证。
- [8] Task-Focused Memorization for Multimodal Agents,2026-05-29。 论文;官方仓库。Seed 与复旦联合研究;流式问答设置不等于完整部署系统。
- [9] Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training,2025-01-20,修订 2025-03-24。 论文;官方仓库。有限交互环境实验。
- [10] Teaching Language Models to Critique via Reinforcement Learning,2025-02-05。 官方论文页面;论文。CTRL 在代码批评和纠错上的结果,不代表通用验证已解决。
- [11] UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning,2025-09。 论文。读取摘要与公开报告说明;模型训练、沙箱和 rollout 路线为 B。
- [12] bytedance/UI-TARS,截止日快照。 官方仓库;Desktop 系统。版本发布、模型和运行系统范围分别处理;官网自评不是独立排名。
- [13] bytedance/deer-flow,截止日快照。 官方仓库。开放 Harness,不等于 Seed 内部全量系统;营销称谓 SuperAgent 不作为超级智能认定。
- [14] verl-project/verl,截止日快照。 项目仓库。由 Seed 发起、社区维护;当前社区贡献不可全部归为单一公司的成果。
- [15] DAPO: An Open-Source LLM Reinforcement Learning System at Scale,2025-03-18,修订 2025-05-20。 论文。大规模 RL 配方与开放实现;有限模型和评测条件。
- [16] MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production。 官方页面,标示 2026-04-26;论文 2605.08962。官网日期与 arXiv 标识月份不同,报告不据此推定首次生产部署日。
- [17] Charon: A Unified and Fine-Grained Simulator for Large-Scale LLM Training and Inference,官方页面标示 2026-05-16。 官方页面;论文。性能模拟与配置优化,不代表所有模型研发自动化。
- [18] Seed-Prover 1.5: Mastering Undergraduate-Level Theorem Proving via Learning from Experience,2025-12-19。 论文。形式数学及公开证明;竞赛任务、时间与计算条件不应默认与人类完全相同。
- [19] BFS-Prover 研究说明,2025-02-25。 官方技术说明。用于分析专家迭代与 Lean 反馈,不采用宣传中的泛化性强表述。
- [20] VideoWorld: Exploring Knowledge Learning from Unlabeled Videos,2025-01-16。 官方论文页面。视觉知识与任务实验;仿真和真实环境分别处理。
- [21] How Far is Video Generation from World Model: A Physical Law Perspective,公开页面 2024-11-04,ICML 2025。 官方论文页面。较早受控实验,不能直接评价最新视频模型。
- [22] Seed3D 2.0: Advancing High-Fidelity Simulation-Ready 3D Content Generation,2026-04-22。 官方论文页面。仿真资产和场景生成,不是物理控制成功率。
- [23] GR-3 Technical Report,2025-07。 论文;官方论文页面。真实实验由作者团队实施,尚不等于独立部署复现。
- [24] GR-RL: Going Dexterous and Precise for Long-Horizon Robotic Manipulation,2025-12,采用 v3。 全文;官方研究说明。成功率采用正式评估口径,区分在线新增轨迹与其他前置数据。
- [25] SeedRealtime Audio-Visual Full-Duplex LLM Released: Toward Omni-Modal Natural Interaction,2026-08-05。 官方技术说明。示例与交互路线为公司展示,不作全面现场可靠性证明。
- [26] Protenix-v2: Broadening the Reach of Structure Prediction and Biomolecular Design,官方页面 2026-04-11。 官方论文页面。bioRxiv 研究;靶点与实验命中不能外推临床成功。
- [27] Seed STEM Fellows Program,2026 年项目,截止日快照。 项目说明。邀请规模与预期周期不是已完成招募或成果数量。
- [28] 扣子常见问题,截止日快照。 官方 FAQ。3.0、项目、Agent 身份与本地/云端边界;动态文档与账户实际权益仍可能不同。
- [29] 扣子 AI 编程概述,含 2026-09-08 调整说明。 官方文档。停止新建的是扣子中的该类旧项目入口,文档提供替代方式。
- [30] 扣子编程 OpenClaw 项目服务调整,2026-06-30 起。 官方公告。明确运维成本、存量处理与新版云端 Agent 替代方式。
- [31] Introducing The New SOLO,2026-03-31 beta 公告。 TRAE 官方说明。产品功能方向与当时分阶段开放,不作截止日全球可用性保证。
- [32] ByteDance-Seed/seed-oss,发布记录 2025-08-20,截止日快照。 官方仓库。开放模型范围与许可;不代表最新通用前沿模型也同样开放。
- [33] coze-dev/coze-studio,截止日快照。 项目仓库。开发平台代码开放,不等于云商业服务全部开放。
独立测量、外部研究与权威统计 A
- [34] METR,Task-Completion Time Horizons of Frontier AI Models,页面标示更新 2026-05-08。 测量与方法。Horizon 定义、样本范围及长时段不确定性;不用于推定 Seed 的未测数值。
- [35] METR,Evaluating frontier AI R&D capabilities of language model agents against human experts,2024-11-22。 RE-Bench 研究。用于 AI R&D 可比评估的方法背景,不当作当前 Seed 能力评测。
- [36] Towards a Science of Scaling Agent Systems,2025-12-09,采用 2026-04-08 v3。 论文。相对于 Seed 的外部研究;Google 等参与,有行业利益且任务范围有限。
- [37] AI Research Agents Narrow Scientific Exploration,2026-05-27,采用 2026-07-11 v2。 论文。预印本;研究想法分布和历史代理,不是 Seed 内部审计。
- [38] IEA,Electricity 2026,Demand。 权威统计与预测。行业电力趋势,不是公司耗电统计;未来年份属于预测。
产业与平台事件 C
- [39] Reuters,ByteDance plans to spend $23 billion towards AI infrastructure in 2026, FT reports,2025-12-23。 报道。转述、初步计划,Reuters 当时未能独立核实。
- [40] Reuters,ByteDance developing AI chip, in manufacturing talks with Samsung, sources say,2026-02-11。 报道。匿名项目消息与字节发言人否认并存;不确认量产。
- [41] Reuters,ByteDance developing custom CPU chips to support AI rollout, sources say,2026-05-28。 报道。匿名消息、早期 CPU 项目;未获公司确认。
- [42] Reuters,Qualcomm strikes AI chip deal with TikTok owner ByteDance, Bloomberg News reports,2026-05-26。 报道。Reuters 未独立核实转述内容;不作交付证明。
- [43] Reuters,ByteDance secures $29.6 billion loan in AI push, sources say,2026-09-04。 报道。消息人士披露融资安排与用途;不等于全部用于 Seed 或已经支出。
- [44] Reuters,ByteDance in talks with China's Iluvatar CoreX to purchase AI chips, sources say,2026-06-15。 报道。谈判状态,不能视为已交付芯片。
- [49] Reuters,ByteDance rolls out AI voice assistant for Chinese smartphones,2025-12-01。 报道。当时手机合作与功能披露,不确定截止日所有渠道状态。
- [50] ByteDance tweaks Doubao assistant amid app curbs,2025-12-10,World Internet Conference 页面转载 China Daily 报道。 有来源转载。对当时平台限制与调整的记录;不推定所有限制至今持续。
透明度、数据与新增经验研究 B
- [45] Seed Transparency,截止日快照。 公开页面。列示部分训练内容摘要;不等同统一安全门槛框架。
- [46] Public Summary of Training Data Content for Seed 2.0 Pro,版本 1.0,更新 2026-07-31。 从 Transparency 的 Seed 2.0 Pro PDF 链接获取。披露训练内容与数据规模;正文阅读支持超过 10 万亿文本 Token、超过 10 亿图像。
- [47] Research Scientist – Seed Responsible AI,截止日招聘快照。 官方岗位。只证明公开研究职责与招聘,不证明风险已解决。
- [48] 火山方舟图片理解与视频理解文档,截止日可检索内容。 图片理解;视频理解。本次正文抓取受限,仅采用可检索的特定数据说明,不推及全部产品或合同条件。
- [51] Chain-of-Experience for Continual LLM Improvement,2026-08-18。 论文;全文。Seed 与大学研究者合作;上下文内推理改进,不是基础权重持续更新。
- [52] Sample-Efficient Learning from Agent Experience,2026-07-23。 论文;已读全文。Seed 与 Monash 合作;采用 §4.6 OOD、§4.7 多轮实验;限于对应任务和模型条件。
- [53] Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents,2026-08-12。 论文摘要。全文获取受限,仅采用摘要中研究设计与问题定义,不引用分项结果。
- [54] Seed Publications,截止日快照。 公开论文目录。用于检索与核验最近列示论文;目录本身不是效果证据,也不意味着此后没有内部研究进展。
来源使用与复核记录
本报告特别复核了六类误读:模型发布日期与论文日期;论文早期版与修订版;运行跨度与人类任务 Horizon;训练曲线与正式评估;采购规划与交付资源;产品入口调整与能力整体下线。
未采用维基、匿名社区帖子或聚合榜单作为关键技术结论依据;未用同一研究的官方博客和论文冒充两项独立验证;未把不可访问正文的来源扩展成完整阅读;未从跨公司安全事件推断 Seed 发生过相同事件。
下一版应优先补充独立的经验蒸馏复现、Seed 同口径 Horizon、研发周期审计和现实工作流验收数据。只有新增这些证据,才能实质提高关于智能增长机制的判断强度。