AI News HubLIVE
站内改写1 分钟阅读

InferenceBench:用于AI智能体开放式LLM推理优化的基准测试

InferenceBench是一个新的基准测试,旨在评估AI智能体在开放式LLM推理优化中的能力。智能体需在两小时内优化目标LLM的推理速度,涉及预填充延迟、解码延迟和并发吞吐量等场景。测试显示,智能体虽能超越基线,但往往收敛于单一框架,未能充分探索多样化策略,表明瓶颈在于配置多样性而非领域知识。

来源arXiv AI作者: Jehyeok Yeon, Ben Rank, Maksym Andriushchenko

AI智能体正越来越多地被用于自动化研发任务,然而现有的基准测试通常局限于预设的工作流或狭窄的动作空间。即使那些名义上开放的任务,也常常可以通过检索已知的解决方案并调整少量超参数来解决,这使得我们难以判断强大的结果是源于真正的优化还是记忆化的解决方案。为了应对这一挑战,研究人员推出了InferenceBench——一个全新的基准测试,要求智能体部署一个兼容OpenAI的推理服务器,并在两小时内优化LLM推理的速度。

在InferenceBench中,每个智能体获得一个目标LLM、一块H100 GPU、一个优化场景以及两小时的挂钟时间预算。优化场景包括四个:预填充延迟、解码延迟、并发请求吞吐量,以及一个平衡所有三者的综合场景。研究人员测试了15种前沿智能体配置,结果显示,智能体能够可靠地超越朴素的PyTorch基线,最高实现了8.08倍的加速,并且经常匹配或超过使用默认设置的推理引擎(例如vLLM的4.05倍)。然而,它们仍然低于在相同时间预算下进行的简单超参数搜索(最高达到11.53倍)。

对智能体轨迹的定性分析揭示了有趣的现象:尽管智能体列举了许多相关的优化技术,但它们绝大多数会收敛于同一个推理框架。它们只测试少数几种不同的配置,然后将剩余的时间用于重新测量、修复错误或优化超参数,而不是探索截然不同的策略。这表明,瓶颈不在于领域知识,而在于提出多样化配置、系统评估它们并提交最佳解决方案的能力。

总体而言,InferenceBench反映了智能体在开放式AI工程环境中的运作能力。在这种环境中,记忆化的解决方案只能带来有限的改进,而真正的创新需要智能体具备探索和评估多种策略的能力。该基准测试为评估智能体在复杂、真实的推理优化任务中的表现提供了全新的视角,同时也揭示了当前智能体在开放式任务中的局限性。