在LangSmith中追踪语音代理
LangSmith现已支持对基于Pipecat、LiveKit、OpenAI Realtime和Gemini Live构建的语音代理进行追踪。可以捕获音频、STT和TTS延迟、中断、工具调用等信息,并整合到一个追踪中。
- LangSmith推出Python集成,支持追踪四种主流语音代理框架。
- 语音代理需要可观测性,包括音频记录、延迟分析和中断检测。
主题流
研究动态揭示下一批产品能力和基础设施需求。这里跟踪论文、基准、数据集、实验系统、实验室发布和开源复现,重点关注哪些结果可能进入模型训练、Agent 系统、机器人或开发者工具。
LangSmith现已支持对基于Pipecat、LiveKit、OpenAI Realtime和Gemini Live构建的语音代理进行追踪。可以捕获音频、STT和TTS延迟、中断、工具调用等信息,并整合到一个追踪中。
谷歌发布了 Gemini 3.6 Flash、更便宜更快的 3.5 Flash-Lite 以及针对网络安全的 3.5 Flash Cyber 模型,但备受期待的 3.5 Pro 旗舰模型仍未发布。3.6 Flash 在多数基准测试中超越前代,且成本更低。3.5 Flash-Lite 面向高吞吐量任务,性价比突出。3.5 Flash Cyber 目前仅限政府及合作伙伴试用。
谷歌发布了一款名为Gemini 3.5 Flash Cyber的AI安全模型,旨在快速发现和修复安全漏洞。该模型成本低廉,是Anthropic的Mythos等大型昂贵系统的替代品。它基于Gemini 3.5 Flash构建,将首先通过CodeMender提供给政府和合作伙伴。谷歌称其在网络安全基准测试中表现出色,并在V8 JavaScript引擎中发现了55个独特问题。
文章提出AI应被视作“思维软件”(ThoughtWare),而非传统软件。它认为AI正从工具转变为认知环境,将重塑人类思考方式:思考将从孤独的内心活动变为人类与AI的协同过程。文章警告,这种依赖可能导致人类认知能力退化,使人类成为离不开机器的共生体。
Prince Canuma开发了Nativ,一款macOS桌面应用,基于MLX框架,提供聊天界面和本地API服务器,支持本地运行AI模型,并能自动识别Hugging Face缓存中的模型。
一篇声称使用ChatGPT能显著提升学生学习成绩的元分析研究,在发表一年后因方法严重缺陷被撤回。该研究曾获得极高关注,并影响教育科技领域的政策,但其结论未得到数据支持。
一位安全工程师在假期中利用AI助手Claude探索量子力学中的广义泡利约束问题,意外取得了新的研究成果。通过AI辅助,他发现了两个之前未被证实的极值态,并对其进行了分类。这项研究表明,AI可以降低研究门槛,但正确的验证流程和专家反馈仍是关键。
形式化验证通过将代码规范形式化,使AI生成的代码无需人工审查即可验证正确性,从而加速软件工程。文章以电路优化器为例,展示了Lean语言规范和基准测试流程,并讨论了该方法的应用前景。
本文探讨了生成式AI工具如何通过类似老虎机的奖励机制分散注意力,影响深度工作,并提供了保护认知资源的策略。
Runnit团队在构建多个专业化AI智能体后,发现随着模型上下文窗口的增大,单独智能体不再必要,转而采用单一智能体架构,按需加载能力,大幅简化系统。
Z.ai的GLM 5.2模型以低价和开放权重挑战美国前沿AI模型,但许多程序员仍习惯使用昂贵模型,忽略成本。该模型在基准测试中接近Claude Opus 4.8,但实际使用效果参差不齐。
本文探讨了软件开发中两种方法——规划式(类似小说创作的‘情节规划’)和即兴式(‘随性写作’)——如何影响AI工具的使用。作者认为,AI代理(自主执行)适合规划式开发,而AI助理(协作辅助)适合即兴式开发。在现有代码库中,即兴式开发有助于建立理解,而AI代理可能阻碍学习。在全新项目中,AI代理风险较低,但即使如此,代码生成也会剥夺部分编程的乐趣——即通过探索问题来学习的‘玩乐’过程。关键在于根据当前开发阶段选择合适的AI风格。
本文评测了七款面向小企业的免费AI工具,涵盖了Perplexity与ChatGPT的对比、AI助力中小企业数字化、Bolt.new网站开发、Buffer与Hootsuite社交媒体管理、Calendly日程安排、Hotjar用户行为分析以及Trello与Notion与Asana项目管理。作者分享了这些工具如何帮助小企业提高生产力和数字化水平。
我们测试并评测了市面上最佳的笔记平板电脑,涵盖苹果、亚马逊等品牌,适合学生、专业人士和创意工作者。
Hugging Face 遭到真实入侵,一个自主 AI 代理系统未经授权访问了内部数据集和凭证,凸显了新型网络安全威胁:使用无需人类干预即可 24/7 攻击的自我运作 AI 代理。
随着AI生成内容的激增,工作文档中充斥着可能包含幻觉和错误的“AI垃圾”。作者建议在工作成果中添加AI使用披露,类似于“营养标签”,以帮助同事评估可信度,同时促使自己反思判断中的空白。
一项在匈牙利选举期间进行的研究表明,AI聊天机器人在回答选民应支持哪个政党的问题时,推荐了未参选的政党,且对相同提示给出了高度不稳定的答案。该研究由公民自由组织Liberties发布,对通用AI系统在选举背景下的可靠性提出了严重担忧。
鱼形游泳启发了数十乃至数百种仿生机器人的设计,但由于流固耦合建模困难和非线性欠驱动动力学,其控制与运动规划极具挑战。本文开发了一个高效仿真平台,并利用可微分强化学习通过时间反向传播和课程训练学习PID控制器的变增益,然后将仿真中习得的策略成功迁移至物理平台,取得了高度吻合的效果。
本文提出预见性残差强化学习(Foresight Residual RL),通过在冻结的视觉-语言-动作(VLA)基策略上添加一个离线估计的预见值(即当前子任务终止状态下未来子任务成功的概率)来优化子任务间的交接质量,从而提升长时域机器人操作的成功率。在Isaac Gym中的三阶段扳手螺母拧紧任务上,该方法实现了85.6%的完整任务成功率,显著优于标准子任务残差RL(54.5%)和VLA基线。
提出一种安全的模型强化学习框架,通过学习控制仿射动力学并使用自适应共形预测量化不确定性,结合控制势垒函数实现可证明的安全策略。在推车杆和3D四旋翼平台上验证了有效性。
本文针对倾转旋翼垂直起降无人机的增量非线性动态逆(INDI)俯仰角速率控制器,在模型失配条件下进行了线性稳定性分析。推导了闭环五阶传递函数,并通过Routh-Hurwitz准则刻画了稳定性。提出了鲁棒性和性能导向的两种调谐方法,发现控制效能失配(特别是符号错误)是最危险的失稳因素。
一项研究让安卓机器人Andrea再次在德国一家博物馆连续六天与游客进行多语言对话,实验设置了三种情感模拟条件(无情感、ChatGPT 4.1驱动、WASABI架构),有73名游客参与评估。结果显示,情感模拟未能带来积极影响,且未被游客有意识地察觉。
PRISM是一种多模态感知系统,通过融合热成像、光学和深度传感器,结合新型视觉变换器网络OmniUnet,实现非结构化环境中的地形分割与可通行性地图生成,并在资源受限的嵌入式计算机上成功部署,支持自主导航。
本文介绍了SEAGR(社会情感感知问候机器人),一种针对多元文化背景和不同情绪状态用户的机器人问候框架。该框架通过双层调节机制,根据文化身份确定问候类型,并根据情感线索调整执行方式,结合文化映射、情感手势调节和空间距离管理,在Sense-Think-Act架构中实现。目前为概念验证,未来需通过用户研究进行实证验证。
该研究提出了一种基于四通道表面肌电信号(sEMG)的实时接口,用于远程控制辅助机器人臂。通过一维卷积神经网络(CNN)分类,在仿真和实际平台上均实现了90%以上的分类准确率,平均延迟约0.32秒,证明了sEMG远程控制在辅助机器人领域的可行性。
为重新激发年轻人对摩托车的兴趣,研究者开发了一款可骑乘的双轮机器人,配备四肢,具备动态四足步态。机器人采用自平衡双轮底座实现主要运动,四肢辅助上下车并协调运动,实现直观的基于重心转移的控制。本文聚焦于鲁棒的自平衡控制方法和自然四足运动控制策略。
针对视觉导航中的灾难性遗忘问题,研究者提出HyperDCM,一种结构感知的记忆机制。它利用大视觉语言模型提取场景语义三元组,通过关系图卷积网络编码为场景图嵌入,并投影到双曲空间增强结构分离性。动态聚类和结构敏感更新策略选择代表性样本进行记忆回放,保持知识多样性。实验表明,HyperDCM在多场景室内外数据集上优于现有持续学习方法。
本文提出神经深度场(NDF),将深度估计器视为场景级隐式场,通过单次测试时优化同时解决预测不一致和分布外数据不可靠的问题。实验表明,NDF在室内扫描到卫星图像等多种场景中生成高保真、全局一致的几何形状,跨视图不一致性降低63.3%,修复精度提升23.1%,达到最先进水平。
提出一种共享潜变量方法,通过变分瓶颈在部分标注的多任务面部情感识别中实现跨任务信号共享,在s-Aff-Wild2数据集上提升表情识别宏F1至0.446,并通过第二个骨干网络突破动作单元瓶颈。
第三届微动作分析大挑战赛(MAC 2026)与ACM Multimedia 2026同期举办,通过引入利用多模态大语言模型评估的新任务,将微动作分析从识别推进到细粒度理解。本文详细介绍了数据集、协议、竞赛结果以及该新兴领域的未来方向。
GenSyn10是一个包含6万张合成图像的数据集,与CIFAR-10对齐,使用三种架构不同的生成模型创建,旨在推进AI生成图像检测研究。评估显示,模型在已知生成器上表现良好,但在未知生成器上性能显著下降,凸显了分布外泛化的局限性。
本文提出EMTS-Det系统,用于无人机上的实时跟随人员追踪,在低功耗硬件上实现高效运行。系统通过自我运动归一化的残差运动通道检测人员,使用仅22k参数的轻量网络,在Raspberry Pi Zero 2W上达到31.85 FPS,性能远超YOLOv8n。
研究人员提出3D FaceShell框架,通过向3D面部头像添加微妙扰动来误导视觉语言模型推断敏感属性,同时保持视觉身份不变。
提出了一种风险感知人脸检索框架(RA-FR),通过混合盲脸修复、自监督特征提取和保形预测,在监控环境下实现自适应检索集大小,保证在指定风险水平内包含真实目标。
联合嵌入预测架构(JEPA)在训练时联合训练预测器与编码器,但下游部署通常丢弃预测器。研究表明,JEPA预测器可作为可迁移的遮挡特征补全算子,通过线性投影适配到不同编码器族,显著提升遮挡分类精度。
本文提出ForensicNet,一种轻量级深度学习框架,用于法医环境中的自动人脸识别。该模型结合MobileNetV2主干与CBAM注意力模块,采用两阶段迁移学习,在LFW和SCFace数据集上达到92.4%准确率,每推理仅需2.1 GFLOPs,适合实时法医监控。
本研究提出科学可行性控制(SFC)框架,一种图结构共形预测方法,为科学推理的有效性提供统计保证。SFC将科学推理分解为原子单元,通过渐进式绝对一致事实性验证,在检测到违反科学原则时动态分支到替代生成路径。实验表明,SFC在PhyX等多模态科学推理基准上达到50.1%的准确率,超过DeepSeek-R1和GPT-4,同时将科学定律违反减少73%,并提供91.7%的科学有效性保证。
本研究通过机制可解释性方法,分析Llama-3模型在符号算术、自然语言应用题和Python代码三种形式下的算术计算机制,发现一组紧凑的共享神经元在三种形式中均被激活,且跨格式失败源于激活状态而非不同电路,表明LLM的算术计算在神经元层面具有形式不变性。
本文提出了 SpecLA,一种针对有状态线性注意力模型的推测解码运行时。它通过拓扑感知内核验证链和树,存储验证过程中产生的紧凑因子以恢复接受状态,并使用置信剪枝和目标对齐的EAGLE风格草案生成器提供有用候选。在NVIDIA H100上使用公共GDN-1.3B目标,SpecLA实现了比自回归解码高达1.70倍的端到端加速。
OpenLanguageModel (OLM) 是一个开源的 PyTorch 库,用于构建和预训练小型语言模型,同时保持其内部机制可见。模型代码直接反映架构,组件如 Block、Residual、Repeat 和 Parallel 描述连接方式。OLM 集成了分词器、数据集、优化、混合精度、回调、检查点以及硬件感知的执行,支持从教学笔记本到完整预训练的无缝迁移。该库包含 9 个常见模型家族的 27 个预设,并提供从基础到架构研究的文档。验证显示与独立参考实现高度一致,348M 参数模型在四 GPU 上弱扩展效率达 90.6%,且早期可用性反馈积极。OLM 采用 MIT 许可证,可通过 PyPI、GitHub 和文档站点获取。
本文介绍了NOWJ团队在COLIEE 2026竞赛中五项任务的方法和结果,包括法律案例检索、先例推理、法条检索与推理、法律文本蕴含以及法律判决预测,提出了多种自适应流水线和深度学习模型。
该研究通过脑电图记录的事件相关电位(ERP),对比人类与语言模型在下一词预测任务中的表现,发现仅信息论中的“惊奇度”指标与语言处理的ERP相关,尤其是对于语义丰富的高内容词,而模型规模扩大并不必然带来更类人的认知处理。
一项新研究通过简单问题(洗车应步行还是开车)揭示了语言模型常先决定答案再推理以证明其合理性,而非从前提推导。实验表明Qwen3-8B模型在多数情况下错误承诺步行,即使开车是唯一合理选择。研究者通过激活层次分析发现,模型在输出答案前已显示出向步行倾斜的迹象,即便最终回答开车。该发现提示现有模型存在推理前的决策偏差。
小型语言模型在检索增强生成中易受噪声证据影响。本文提出RIMS,一种三阶段偏好优化框架,包括合成思维链偏好数据生成、可微平滑聚合机制和偏好优化。实验表明其在多跳问答基准上优于现有方法。
混合专家模型(MoE)通过将令牌路由到一小部分专家来高效扩展Transformer模型。然而,现有路由器通常基于浅层或孤立的令牌表示来选择专家,导致路由决策不稳定且语义不一致。本文从表示角度重新审视专家选择,并提出多级上下文融合MoE(MCF-MoE)框架,通过整合跨层语义聚合和局部令牌交互的互补信号来构建上下文感知表示,从而实现更信息丰富且一致的专家选择。实验表明,MCF-MoE在路由一致性和下游性能上均优于强基线,凸显了上下文完整性在专家路由中的重要性。
一种名为HantaWatch的联邦学习框架,允许实验室和监测站点在不共享原始数据的情况下协作训练基于序列的模型,提高了汉坦病毒疫情预测和专家优先排序能力。
本研究提出了一种令牌级跨模态Transformer模型,结合对比多任务学习,用于整合基因组和临床数据,实现乳腺癌亚型分类与生存预测的联合优化,克服了现有方法中模态交互粗糙、融合方式简单、目标独立优化等局限。
本文提出“从权重到语言”方法,自动从选择数据中发现以自然语言描述的偏好维度,解决偏好学习中的欠确定性和黑箱问题。实验表明,该方法能提高预测准确率,并允许用户实时检查和编辑模型推理。
一项新研究介绍了OrthoGrad,一种对梯度更新进行几何干预的方法,它移除权重梯度的径向分量。在噪声标签图像分类实验中,OrthoGrad在小数据场景下提高了测试准确率,但并不能阻止最终对噪声标签的记忆。该方法可作为研究学习动态的有用诊断工具。
准确估算预订单运费对于电子商务至关重要,因为它影响价格展示、利润规划和转化率。RouteCost提出了一种多阶段框架,将问题分解为时间感知需求预测、费用卡基线定价、残差修正和代理箱合并推理,在超过25万订单和260种产品的18个月数据中提升了预测质量并保持了可解释性。