Induction Labs推出Photon-1:从一次预训练中模拟桌面、下跳棋并建模台球物理
大多数从视频中学习的智能体需要知道每个帧是由什么动作产生的。Induction Labs认为这一需求是瓶颈。上周,他们发布了想象模型(imagination models),这是一种无需任何动作标签即可在原始视频上进行预训练的基础模型架构。其测试系统Photon-1是一个稀疏的106B-A5B混合专家(MoE)模型,在18年的计算机演示视频上训练。在内部计算机使用基准测试中,Photon-1以远少于Gemini 3.1 Flash-Lite的预训练计算量和约3倍的推理成本,击败了后者。
Induction Labs近日发布了Photon-1,一个基于想象模型架构的稀疏混合专家(MoE)网络,参数量为106B(激活参数5B)。该模型的核心突破在于:无需任何动作标签,仅通过分析计算机屏幕录制视频,即可学习执行任务的能力。传统视频智能体需要知道每一帧对应的具体操作,而Photon-1通过预测下一个帧的潜在表示,隐式学习了用户行为模式。
Photon-1采用了一种高效的视觉编码器,基于有限标量量化(FSQ)技术,将每帧压缩为960个离散令牌,每个令牌为8维向量,每个维度取值于{-1, -1/2, 0, 1/2, 1},从而形成5^8种可能编码。这种编码每帧仅占约2.2 KB,相比OCR和多模态方法实现了超过100倍的压缩比,同时保留文本、布局和状态变化信息。为了实现如此高的压缩率,Photon-1使用了差分潜在编码器,将视频帧作为对进行编码,从而捕捉帧间差异而非帧内容本身。
在数据方面,Induction Labs从内部索引的20亿公共视频中筛选出约200万个计算机屏幕录制视频,再通过关键帧检测去除冗余帧,最终得到5.75亿帧数据集,采样率为1帧/秒,相当于18年的视频时长,共5520亿令牌。Photon-1在此数据集上从头训练了一个epoch,使用32K上下文长度,消耗约30,000个H200 GPU小时,计算量约为4.4×10²² FLOPs。训练基于PyTorch实现,并针对视觉编码器和MoE层定制了融合内核,保持了40%的端到端模型利用效率(MFU)。
为了将模型从想象转化为实际行动,研究团队在少于35,000条计算机使用轨迹上对Photon-1进行了微调,使其学习动作和指令格式。微调后,模型在推理时首先预测下一帧状态,然后输出到达该状态所需的动作。此外,他们还采用了在线强化学习,在虚拟机中大规模运行真实桌面环境(包括LXQt、Xfce、MATE、GNOME和Plasma),并通过程序化验证给出奖励信号。
在性能对比上,Photon-1仅使用0.044×10²⁴ FLOPs的预训练计算量,而Gemini 3.1 Flash-Lite约为1.2×10²⁴ FLOPs,相差约27倍。在内部计算机使用基准测试中,Photon-1超越了Gemini 3.1 Flash-Lite,且推理成本仅为后者的约三分之一。不过需注意,该结果为Induction Labs内部评估,尚未独立验证。
更令人惊讶的是Photon-1的泛化能力。尽管仅在桌面视频上预训练,但经过微调后,它在国际跳棋(20,000局公开棋局)和台球物理模拟(10,000局合成数据)任务上,均显著优于同规模的视觉编码基线与Ling-flash-2.0大语言模型基线。在台球任务中,Photon-1的均绝对误差(MAE)仅为0.47,远优于LLM基线的1.15和视觉基线1.44。此外,模型还通过强化学习学会了使用虚拟机内的ChatGPT克隆体来起草内容或回答知识问题,体现了人类操作者的行为偏好。
尽管成果令人印象深刻,但Induction Labs目前未公开模型权重、API或许可证,本工作仅为研究性成果。完整的技术白皮书已在官网发布。