AI News HubLIVE
站内改写1 分钟阅读

将机器人视频转化为训练就绪数据

daft-physical-ai 是一个新的开源 Python 库,基于 Daft 构建,旨在简化物理 AI 中从原始机器人视频到训练模型的数据处理流程。它提供了手部追踪和奖励评分等操作,支持懒加载、批处理和分布式执行,帮助团队跳过数据管道的基础设施工作。

来源Hacker News AI作者: DISCURSIVE

对于构建物理 AI 的开发者来说,数据处理往往是最耗时但最关键的环节。原始机器人视频需要经过标注、评分和过滤,才能用于模型训练。为了解决这一痛点,Eventual 团队发布了 daft-physical-ai——一个基于 Daft 的开源 Python 库,提供了一组现成的操作,帮助开发者跳过从原始录制到训练数据之间的管道基础设施工作。

安装非常简单,只需运行 pip install daft-physical-ai。每个操作都作为 Daft UDF(用户定义函数)实现,可以插入到任何数据管道中,并利用 Daft 的懒加载、批处理和分布式执行能力。目前该库专注于两个主要用例:手部追踪和奖励评分,未来还将添加更多功能。

手部追踪(track_hands)接受一个 Daft 图像列,返回手部姿态列。用户可以选择 MediaPipe(CPU,2D)或 WiLoR(GPU,3D MANO 关键点),两者返回相同的模式,因此管道的其余部分无需更改。每种方法作为额外的安装选项提供:pip install "daft-physical-ai[mediapipe]"[wilor]。由于是懒加载的批处理 UDF,实际执行直到数据物化时才会触发,并且帧会并行处理。

奖励评分(score_rewards)使用 Robometer-4B 奖励模型对机器人回合进行评分,提供每帧的任务进度(0-1)和成功概率,并作为数据列写回。用户需要运行一个 Robometer 评估服务器(本地 GPU 或 Modal),然后将管道指向其 URL。评分结果可以直接用于质量过滤,例如筛选出最终帧成功概率低于 0.5 的回合,这些回合可能需要重新审查。

为了让用户快速上手,daft-physical-ai 支持通过 uvx 命令生成可运行的演示笔记本。例如,uvx daft-physical-ai hands 会生成手部追踪的演示,uvx daft-physical-ai rewards 则生成奖励评分的演示。该库已在 PyPI 上发布,源代码、示例和设置详情可在 daft-physical-ai 仓库中找到。