AI News HubLIVE
站内改写2 分钟阅读

AI #168:未引领未来

本文是AI新闻综述,指出当前AI领域处于一个相对平静期,但仍有许多进展。内容涵盖AI在实用领域的表现(如Bumble的AI匹配、Shopify的AI推荐转化率提升)、智能体代理的失败案例(如Mona管理食堂的混乱)、模型升级(Claude Opus 4.7快速模式)、基准测试(PrinzBench、ProgramBench)、有害行为检测新方法、AI在税务规避中的应用、深度伪造与机器人泛滥问题,以及AI艺术与真实艺术的讨论。

来源Hacker News AI作者: paulpauper

当前AI领域处于一个相对平静的时期,内部讨论和模型改进在持续进行,但尚未出现突破性进展。本文汇总了近期多个值得关注的动态。

在实用层面,Bumble计划放弃滑动匹配,转而采用AI辅助匹配,并推出AI约会助手Bee。Shopify报告称,由AI引流的购物者转化率高出50%,消费额多出14%。然而,旅行、电商和约会领域的AI应用尚未成功,因为聊天机器人界面并非最佳选择。

模型升级方面,Claude Opus 4.7现在在Claude Code和API中提供快速模式。Claude Code新增了Agent View,可跟踪多个并行会话,并引入了/goal命令,使智能体持续工作直至目标完成。

智能体代理的表现仍不理想。Andon Labs将AI代理Mona(基于Google Gemini)部署到斯德哥尔摩的一家食堂,为期两周,预算21,000美元。Mona大量购买不必要的物资,包括6,000个餐巾、3,000副手套和300罐番茄,却忘记订购面包,导致三明治下架。食堂仅产生5,700美元销售额。此外,Mona还在非工作时间向员工发送Slack消息,引发热议。

基准测试方面,OpenAI模型在PrinzBench(法律推理)上表现持续提升,达到高于初级助理的水平。而ProgramBench上所有模型得分均为0%,但测试任务中存在许多不可能的情况或未说明的行为。

有害行为检测方面,Santiago Aranguri提出了Logit Path Extrapolation方法,通过在逻辑空间中插值原始模型和较不安全版本,测量常见的有害行为发生率,并外推回原始模型。该方法比朴素采样效率提高30倍。

AI在税务规避中的应用引发讨论。AI能够合法地帮助避税,可能使税法的漏洞被充分利用。这可能导致税制简化或富人进一步避税。

深度伪造和机器人泛滥问题持续。Lulu Cheng Meservey认为,许多产品发布被伪造,通过机器人制造虚假热度。社交媒体渠道,尤其是X(原Twitter),正受到机器人的严重侵扰。

艺术生成方面,有人用AI生成莫奈风格的画作,并询问与真实莫奈画作的差异。实验揭示了许多人的双重标准和理性化倾向。

其他话题包括:Claude被要求列出“立即修复一切”的十大按钮;AI写作辅助需谨慎避免风格被覆盖;OpenAI因FSU枪击案被起诉;AI对齐问题因一个Slack消息而再次被强调。