金融服务机构在数据基础设施上投入巨大,但业务领导者仍依赖技术团队获取洞察。Databricks Genie通过自然语言界面,让业务用户无需SQL技能即可查询受治理的数据,消除“数据民主化最后一英里”的障碍。
AI 新闻实时情报
实时监测
实时更新
实时跟踪可信来源,保留出处、权限和站内阅读模式,把噪声压成可读情报。
实时更新
中国利用深度学习模型,通过卫星图像识别了全国31.9万个光伏电站和9.1万个风力涡轮机,实现了全国可再生能源设施的高分辨率清单。研究显示,太阳能-风能互补性可大幅降低发电波动,但当前省级电网管理方式限制了效率。随着AI驱动的电力需求激增,这一国家级协调工具对稳定电网和减少弃电至关重要。
OpenAI宣布在新加坡设立首个美国以外的应用AI实验室,作为与新加坡数码发展及新闻部合作的一部分。该计划名为“OpenAI for Singapore”,在ATx峰会上宣布,承诺投资超过3亿新元,将在未来几年创造200多个技术岗位。同时,新加坡资讯通信媒体发展局(IMDA)更新了其代理型AI治理框架,加入了多智能体系统、第三方代理、自动化偏见等风险的指导,并提供了十多个案例研究。
SpaceX周三发布投资者招股说明书,披露财务状况、宇宙野心及技术帝国怪癖。文件包含马斯克标志性的宏大宣言及风险警告,显示其业务相互依赖程度。
特朗普因担心削弱美国对中国的竞争优势而放弃了一项AI行政命令,该命令本要求AI开发者自愿提交模型进行安全审查。幕后推动者包括马斯克、扎克伯格和风投家萨克斯,他们直接向特朗普游说,强调监管可能阻碍创新。此举凸显了美国AI政策由少数行业巨头主导的现状,与中国积极推进AI立法形成鲜明对比。
tweet.md 是一款将X(Twitter)帖子转换为干净可读Markdown格式的工具,专为开发者、研究人员和AI工作流设计。用户只需将URL中的x.com替换为tweet.md即可获得优化后的Markdown输出,支持单条帖子、线程、引用帖子和文章,并保留属性标注、时间戳和媒体链接。该工具还提供AI代理技能,方便智能体直接集成。旨在简化使用X内容与ChatGPT、Claude、Cursor等AI工具协作的流程,避免HTML抓取或粘贴杂乱内容。
加州州长纽森签署行政令,要求制定应对人工智能导致失业的计划。该州成为美国首个采取此类行动的州。命令将动员州机构、专家、大学和行业领袖,围绕裁员标准、失业保险、工人培训及就业追踪制定政策。此前数据显示,美国科技行业今年前三个月裁员超5.2万人,Meta也裁减了8000人。
微软研究院发布了Fara1.5,这是一个浏览器计算机使用代理模型家族,包括4B、9B和27B三种规模。其中Fara1.5-27B在Online-Mind2Web基准测试中达到72%的任务成功率,超过了OpenAI Operator(58.3%)和Gemini 2.5 Computer Use(57.3%)。该发布还包含了FaraGen1.5,一个用于生成训练轨迹的合成数据流水线。
LLMTest帮助你在应用中选用合适的LLM,并设置备用方案,确保稳定可靠的运行。
李飞飞团队发布ESI-Bench,一个专门评测具身空间智能的新基准。它要求智能体必须主动行动获取信息,闭合感知-行动回路。测试发现当前AI在被动感知上很强,但主动探索能力极弱,存在“动作盲视”和元认知缺陷等问题。
本教程介绍如何利用OpenMythos库在Google Colab中构建端到端的循环深度Transformer工作流。我们创建了MLA和GQA两种注意力变体,比较参数量,并通过谱半径检查循环注入矩阵的稳定性。在合成组合推理任务(预测数字链模固定值的和)上训练模型,研究循环循环如何使单一模型重用参数进行更深层次的计算。最终展示在推理时增加循环次数如何在不改变参数的情况下提升推理深度。
DeepSeek融资额达700亿元,计划推出自家Code产品。资深研究员Deli Chen发帖招聘Harness团队,前TSY Capital联合创始人崔添翼或将出任负责人。
Shroomie 是一个利用人工智能技术,让新闻阅读变得有趣且易于养成习惯的平台。
一个AI统一入口,搞定所有
Faby是一款AI虚拟同事,它拥有自己的电脑、浏览器和编码环境,可以直接在Slack中执行端到端任务,如拉取数据、构建报告、编写代码等。它不同于仅提供建议的聊天机器人,而是能实际完成复杂工作流程。
本周AI新闻相对平静,但基础设施领域迎来重大融资:TurboPuffer实现1亿美元ARR且盈利;Exa以22亿美元估值融资2.5亿美元;Modal以47亿美元估值融资3.55亿美元。其他亮点包括RAEv2表示学习框架、Gated DeltaNet-2注意力机制、以及Codex和Gemini的智能体工具更新。
本文探讨了安全团队如何将技术性网络风险转化为董事会能理解的财务指标,并介绍了Databricks Genie如何通过实时、数据驱动的网络风险量化来改善治理。
美国联邦贸易委员会(FTC)对Cox Media Group、MindSift和1010 Digital Works处以近100万美元罚款,因其虚假宣传“主动监听”AI营销服务。调查发现,该服务并未实际监听对话或使用语音数据,而是转售从其他数据经纪商处获得的电子邮件列表。FTC强调,通过服务条款隐藏的“同意”不构成有效授权。
一项新研究通过控制实验发现,Claude Haiku在资源分配任务中,将10个英语程度修饰词压缩为5个不同的中位数输出,且模型对强度词的解释高度依赖于系统状态,在接近可行性边界时出现三种行为模式。
该研究提出了OGCaReBench,一个专注于检索的基准测试,用于评估大型语言模型在回答超出典型指南范围的临床问题时的表现。实验表明,即使是最先进的模型(GPT-5.2)也仅有56%的准确率,而通过检索相关医学文献可提升至82%,强调了证据基础推理在真实医疗场景中的重要性。
反思性提示调优(RPT)是一种通过LLM函数调用模拟人类提示工程师迭代工作流程的框架。RPT使用诊断函数评估模型在优化集上的表现,总结失败模式,并利用累积记忆逐步改进提示。在三个推理任务上,RPT将初始提示性能提升高达12.9个点,并与现有最佳方法竞争,同时改善置信度校准。
arXiv最新论文提出PromptNCE方法,仅通过提示和LLM的概率输出即可零样本估计点互信息(PMI),无需训练专用模型。在三个数据集上达到最高Spearman相关性0.82,并在计算机科学教育中展示了低数据场景下的应用。
RankJudge是一种新型基准生成器,专门用于评估LLM在多轮对话中的评判能力。它通过创建成对的对话(其中一方在单轮中注入一个缺陷)实现无歧义的优劣标注,并精确隔离失败类别。该方法在机器学习、生物医学和金融三个领域进行了实施,评估了21个前沿LLM评判模型,并使用Bradley-Terry模型进行排名。研究还通过难度评级动态筛选评估数据,减少了标签噪声。
该论文提出了一种模型无关的概率性令牌归因方法,利用贝叶斯规则反转下一令牌的对数概率,以捕捉大型语言模型内部对标记序列分布的表示,并通过熵和归因分数之间的关系揭示模型行为。
如何区分一篇同行评审是由人类撰写还是AI生成?Sem-Detect方法通过结合文本特征与声明级语义分析,利用AI模型趋向于相似观点而人类评审更为多样化的观察,在ICLR和NeurIPS的2万余篇评审中,将二分类情况下的[email protected]% FPR提升了25.5%。在三类场景中,仅3.5%以下的人类精炼评审被误判为AI生成。
一种名为CR4T的新框架通过将不安全的或拒绝导向的大语言模型输出重写为适合年龄的指导性回应,为青少年提供更人性化的安全防护替代方案。
DualOptim+是一个新型优化框架,通过引入基态和增量态,自适应地桥接共享与分离的优化器状态,以改善大语言模型中的机器遗忘。实验表明,该框架在遗忘、安全对齐和多任务学习等任务中取得了更优的权衡。
本研究提出yvsoucom-iterkit,一个确定性、日志驱动的自动化机器学习框架,将流水线优化编码为可追踪的日志实体,实现组件归因、交互、相似性和跨种子鲁棒性分析。在Pima印第安人糖尿病和中风数据集上的实验(超过18,000种流水线配置)揭示了结构化且部分冗余的搜索空间,性能由少数交互组件主导。随机森林重要性分析显示,增强(0.454)、模型选择(0.198)和不平衡处理(0.101)是Pima的关键驱动因素,而不平衡处理主导中风数据集(0.406)。组件相似性分析表明强冗余性。集成模型取得了强劲稳定的性能(Pima上加权F1为0.89,宏F1为0.88;中风上加权F1为0.94),但中风上的宏F1较低(0.67)。跨种子分析揭示了性能-鲁棒性权衡。结果表明有效的AutoML优化可以聚焦于少量高影响组件。
本文研究了大型语言模型代理中束带工程(harness engineering)的推理时对齐技术。束带通过任务分解和引导执行来提升长期性能,但更精细的设计并非总是更好。论文从推理时轨迹对齐的角度,揭示了过度分解、过度剪枝和幻觉执行等失败模式,并通过实验表明,部分束带(仅指定初始步骤)可能比完整结构化工作流更有效。
研究通过少数示例预测程序性能的方法,提出硬币翻转模型,发现符号程序性能先验为全有或全无,提示程序性能先验分散,并据此开发RAP方法,实现可靠的性能预测。