AI News HubLIVE
站内改写2 分钟阅读

NASA将谷歌Gemma大语言模型送入轨道

NASA喷气推进实验室成功将谷歌Gemma 3大语言模型部署到太空,首次在轨演示了视觉语言模型分析卫星自身传感器图像的能力。该系统名为NAVI-Orbital,在Loft Orbital的YAM-9卫星上运行,仅需8GB内存即可在低功耗设备上执行任务,为卫星图像分析带来了范式转变。通过语义压缩,卫星可以传输文本摘要而非大量原始数据,有望将野火检测等任务的延迟从90分钟降至近乎实时。

来源IEEE Spectrum AI作者: Matthew S. Smith

美国宇航局(NASA)喷气推进实验室(JPL)近日完成了一项历史性突破:将谷歌的Gemma 3大语言模型(LLM)送入太空,并成功进行了首次在轨视觉语言模型图像分析演示。这一名为NAVI-Orbital的系统在Loft Orbital公司制造的YAM-9卫星上运行,标志着航天器交互方式的一次重大转变。

NAVI-Orbital是一个基于智能代理的软件框架,由NASA JPL的Juan M. Delfa、Taran Cyriac John以及Loft Orbital的技术负责人Andrew W. Herson共同开发。该系统采用LangGraph为基础协调器,部署了谷歌Gemma 3 4B模型的压缩4位版本,这是一个开放权重的LLM,能够生成纯文本的图像描述。

在发射前的基准测试中,NAVI-Orbital在包含7,960张图像的测试集上达到了88%的分类准确率。值得注意的是,Gemma 3模型并未针对该特定数据集或类别进行训练或微调——它使用的是与Hugging Face上可下载版本相同的预训练基础模型。

进入轨道后,NASA研究人员进行了两次实时捕获测试:一次在法国图卢兹上空,另一次在阿根廷海岸附近。除了生成图像的文字描述外,NASA还通过一组脚本问题向Gemma 3提问,例如图像中是否包含商业区、住宅区或自然特征。

图像分析在YAM-9卫星上本地完成。该卫星配备了一个由多个抗辐射处理器(FPGA、CPU和GPU)组成的计算集群,可同时服务于多个客户负载。卫星由太阳能电池板供电,根据卫星位置,机载系统可获得150至500瓦的电力。

在实时捕获实验中,Gemma 3运行于Nvidia Jetson Orin AGX上——这是一个常用于机器人和AI任务的小型计算模块。40亿参数的4位模型仅需8GB内存,使其能够在Orin AGX这样低功耗的设备上运行。Delfa形容道:“这传达了它多么轻量级的信息。你可以在一个非常小的计算机上运行它。”

Loft Orbital总经理Paul Lasserre表示,具备视觉能力的LLM可为轨道操作带来“范式转变”。与间谍电影中描绘的相反,大多数卫星无法向地面观察者提供快速、高保真的图像和视频流。带宽通常有限,且大多数情况下,卫星只能根据其轨道在设定的时间间隔内向地面站传输数据。

Lasserre认为AI模型可以通过“语义压缩”解决这一问题。卫星无需发送大量原始图像数据,而是传输一份包含值得注意信息的文本摘要。“无论链路有多慢都没关系,因为你只需下行几十千字节,而不是几十或几百兆字节,”Lasserre说道,“这让你能够以战术方式使用卫星,而此前这只有在好莱坞电影中才能实现。”

Delfa用一个野火检测的实际例子进一步阐述。当前卫星能够检测野火,但下链带宽和数据处理能力的限制可能导致结果延迟长达90分钟。具备在太空分析图像并报告纯文本警告能力的卫星可能消除这一延迟。

更快的洞察只是NAVI-Orbital所指向目标的一半。另一半与Delfa强调的“重大转变”有关。NAVI-Orbital为一种与航天器交互的替代方式提供了概念验证。

这并不是说谷歌Gemma 3目前正在操控航天器。NAVI-Orbital故意与飞行软件隔离。它读取图像并生成描述。该系统能够决定如何分析图像,但无法访问其他功能。

尽管如此,其界面是新颖的。将系统重新配置以搜索不同类型的目标——例如野火——只需编辑文本提示即可。这无需重写和重新验证机载软件,也无需训练和部署不同的AI模型(此前图像分类模型通常需要这样做)。

长远来看,这一能力的部署前景远超无人卫星和图像处理。Delfa表示,NAVI的构想源于AI如何作为宇航员的伴侣。“我们想到,宇航员在宇航服中灵巧性受到很大限制,所以我们构思了NAVI作为宇航员的伴侣,通过自然语言进行交互……这是我们坚决要推进的概念。”

尽管要将该技术推进到那一步还需要大量额外研究,但NAVI-Orbital的演示已经证明了两件事:在太空部署大语言模型以及通过提示控制模型是可行的。

NASA将谷歌Gemma大语言模型送入轨道 | AI News Hub