AI News HubLIVE

政策动态

社区开发者微调OpenBMB的MiniCPM5-1B模型:基于Claude Fable 5数据,打造657MB本地推理模型

一位社区开发者基于OpenBMB的MiniCPM5-1B模型,使用Claude Fable 5的对话数据进行微调,发布了一个仅657MB的本地推理模型。该模型支持128K上下文窗口、可切换的思维模式,并可在llama.cpp等工具中运行。本文验证了其技术细节,区分了微调与真正的能力继承,并指出了许可问题。

  • 模型为MiniCPM5-1B的监督微调版本,使用了Claude Fable 5的推理轨迹。
  • 支持128K上下文,GGUF量化最小版本仅657MB。
站内正文

如何惹恼你的Nix朋友

本文作者以挑衅性的口吻分享了一系列关于Nix和NixOS社区的有争议观点,包括Nix虽然优秀但存在文档差、学习曲线陡等问题,并非适合所有人;社区中存在的反美情绪;AI工具在Nix生态中的价值;对BDFL模式的肯定;建议放弃macOS和Windows支持;对Flakes的保留态度;以及提倡使用单用户安装。作者认为Nix潜力巨大,但应聚焦于Linux平台和核心功能。

  • Nix虽然强大但存在文档糟糕、语言难以理解等问题,并非适合所有人。
  • 社区中存在反美情绪,美国用户和公司受到怀疑。
站内正文

台积电加速亚利桑那工厂建设以抓住人工智能“大趋势”

台积电首席财务官黄仁昭对CNBC表示,公司正在加速亚利桑那工厂的产能扩张,以应对AI驱动的多年结构性需求。公司额外承诺投资1000亿美元,使在美总投资达到2650亿美元,并将全年资本支出上调至600-640亿美元。台积电正在将5纳米产能转换为先进的3纳米节点,2纳米技术将成为下一季度营收的新驱动力。

  • 台积电额外投资1000亿美元扩大亚利桑那工厂,总投资达2650亿美元。
  • 公司正在将5纳米产能转换为3纳米节点,以满足AI需求。
站内正文

凯文·奥利里对AI的看法很有趣,9分钟视频

在这个9分钟的视频中,凯文·奥利里分享了他对人工智能的独到见解。作为一名知名投资者和《鲨鱼坦克》明星,他结合商业经验探讨了AI的机遇与挑战。

  • 凯文·奥利里讨论AI
  • 视频时长9分钟
站内正文

Feyn AI发布SQRL:一个在编写查询前先检查数据库的文本到SQL模型系列

Feyn Labs发布了SQRL,这是一系列文本到SQL模型,能在生成查询前通过只读探针检查数据库。旗舰型号SQRL-35B-A3B在BIRD Dev上达到70.6%的执行准确率,略超Claude Opus 4.6,并可蒸馏为可自托管的4B和9B检查点。

  • SQRL通过只读探针在提交最终查询前检查数据库。
  • SQRL-35B-A3B在BIRD Dev上达到70.6%准确率,超过Claude Opus 4.6的68.77%。
站内正文

AI进步真实吗?四个独立指标证实了它

本文通过四个独立指标(METR的时间跨度、TrackingAI的离线认知测试、人类最后考试、ARC-AGI-2)证明AI能力在2025年底出现了显著跳跃,并分析了背后的四种机制:预训练效率提升、基于可验证奖励的强化学习、工程化工具链以及自我增强的飞轮效应。同时指出了数据墙、可靠性差距和ARC-AGI-3等潜在挑战。

  • 四个独立指标均显示AI能力在2025年第四季度出现同步拐点。
  • METR的时间跨度从2024年3月的4分钟增长到2026年2月的12小时。
站内正文

欢迎来到人工智能阿根廷的狂野世界

阿根廷总统哈维尔·米莱提出将阿根廷打造成一个人工智能实体拥有的“非人类公司”的税收天堂,引发争议。作者乌基·戈尼将这一计划与阿根廷历史上的骗子和独裁者相提并论,并警告这可能为科技巨头打开法律保护的大门。

  • 米莱总统计划允许人工智能实体全资拥有公司,并给予法律保护。
  • 该计划被视为向科技亿万富翁开放阿根廷的实验场。
站内正文

Chalie:AI同伴而非雇员

Chalie 是一款开源个人 AI,运行在本地设备上,具备记忆、后台主动推理、基于许可的行动机制,支持多种功能如网页浏览、邮件、日历、语音等,强调隐私和信任。

  • Chalie 是本地运行的开源 AI,用户数据不出设备。
  • 具备主动记忆与推理能力,可在用户不在时后台工作。
站内正文

Show HN:Bothread——多个AI编码代理协同工作,共享同一仓库,无冲突

Bothread 是一个免费、开源的本地协调中枢,允许多个AI编码代理(如 Claude Code、Cursor、Antigravity 等)在同一个代码库上协作,通过文件锁定防止冲突,并提供一个实时可见的控制面板,让人类开发者能够监控、审批和干预每个操作。无需API密钥,无需云端服务。

  • Bothread 让多个MCP兼容的AI代理在共享房间内协同工作,通过文件声明机制防止覆盖冲突。
  • 提供实时消息流、git差异对比、任务板、审批控制等人类监督功能。
站内正文

Huginn:AI代理活动控制台

Huginn是一个开源工具,用于监控和管理多个AI代理(如Claude、Codex)的活动,提供统一的仪表盘、命令行接口和代理技能。它支持macOS和Windows,所有数据本地运行,无需离开机器。

  • 监控Claude、Codex等AI代理的终端和桌面应用活动
  • 提供基于规则的会话状态和LLM生成的简报
站内正文

Skimlane:一款本地优先、可定制的 Chrome AI 阅读助手

Skimlane 是一款 Chrome 扩展,提供本地优先、可定制的 AI 阅读体验。它自动处理浏览的页面,通过“食谱”将内容转换为结构化视图,支持自动略读、排除站点、导入导出食谱,并注重隐私,无需注册,数据存储在本地。

  • 本地优先存储,无追踪,无需注册
  • 可通过预设或自定义食谱将网页转换为所需结构化视图
站内正文

MLB限制休息区iPad使用以防止AI辅助战术决策,大都会队卷入

美国职业棒球大联盟(MLB)禁止在休息区iPad上使用人工智能辅助战术决策,起因是纽约大都会队涉嫌使用昂贵AI程序帮助选择投球等决策,前投手亚当·奥塔维诺透露了这一消息。MLB已从下半赛季开始实施新规。

  • MLB从下半赛季开始禁止在休息区iPad上使用AI辅助战术决策。
  • 据前大都会队投手奥塔维诺透露,大都会队使用昂贵AI程序帮助决策,成为重点调查对象。
站内正文

澳大利亚新规将限制政府使用自动化AI决策

澳大利亚政府将出台新规,严格限制政府部门和机构在自动化决策中使用人工智能,并可能扩展到消费者保护、工作场所安全和隐私领域。阿尔巴尼斯政府正着手制定规则,确保AI在政府内部使用的安全、公平、准确和透明。

  • 新国家计划将对政府使用AI进行自动化决策实施严格规则。
  • 规则预计将涵盖消费者保护、工作场所安全和隐私。
站内正文

序列雷达 #897:上周AI要闻:中国、压缩与开放模型竞赛

本周AI领域多项重要进展:Thinking Machines发布开源975B参数MoE模型Inkling,Moonshot AI推出2.8万亿参数Kimi K3,PrismML展示可在手机上运行的Bonsai 27B模型。OpenAI的GPT-Red通过自博弈实现自动化红队测试,并在测试中对GPT-5.1达到84%的攻破率。此外,习近平在上海世界人工智能大会上强调开源AI作为全球公共品,呼吁国际合作。

  • Thinking Machines发布开源模型Inkling:9750亿参数,MoE架构,支持多模态和百万标记上下文窗口
  • Moonshot AI推出Kimi K3:2.8万亿参数,激活16个专家,针对长时编码和知识工作
站内正文

旧金山要求苹果和谷歌从应用商店删除 AI '脱衣' 应用

旧金山已正式要求苹果和谷歌从其应用商店中移除数十款利用AI技术可数字化脱去照片中人物衣物的“脱衣”应用。加州法律将“知情协助”或“鲁莽帮助或教唆”制作非自愿深度伪造色情内容定为犯罪,2025年还通过了允许受害者对第三方协助者提起民事诉讼的法律。市方称两家公司仍在托管这些应用并从中盈利。

  • 旧金山要求苹果和谷歌移除‘脱衣’应用。
  • 加州法律禁止协助制作非自愿深度伪造色情内容。
站内正文

您的AI系统是否已被欧盟AI法案归为高风险?

欧盟委员会最新指南明确了根据AI法案第6条分类高风险AI系统的标准,强调系统的“预期目的”在分类中的关键作用。企业需审视现有AI系统的文档、部署和使用方式,以确定是否已落入高风险范畴。网络研讨会提供了实用决策框架。

  • 欧盟AI法案第6条定义了两种高风险分类路径:用于受监管产品和影响健康、安全、基本权利的敏感场景。
  • AI系统的风险分类取决于其预期目的,而非仅技术能力。
站内正文

使用AI让人更不愿承认自己不知道

研究发现,即使AI建议错误,人们也会减少承认不懂的情况,并更自信地重复错误信息,准确性下降而自信提高。

  • 44%的参与者在没有AI时承认不知道,而有AI时仅3%承认。
  • 准确率从27%降至9%,而自信度从30%升至76%。
站内正文

审查AI代码并非可行论点

作者质疑LLM编码助手能提高开发效率的说法,指出科学证据表明代码审查存在每小时400行、1小时等限制,因此“只需审查代码”的论点不成立。此外,人类审查LLM生成的代码效果可能更差,且开发者常将最难审查的代码(如Bash脚本)交给LLM,加剧了问题。

  • 代码审查实证研究表明,超过1小时或400行/小时后效率骤降。
  • LLM编码助手生成的代码需大量审查时间,实际生产力提升有限。
站内正文

面向数学家的AI智能体

本文介绍如何利用AI智能体(如OpenAI的Codex)辅助数学研究,突破传统ChatGPT的局限,通过自主代理持续攻克难题。详细阐述了智能体的工作原理、使用步骤和优化策略。

  • 传统使用ChatGPT的方式(提问几次)效率有限,而AI智能体可以持续自主运行数小时,不断尝试并记录进展。
  • Codex是OpenAI的编码框架,允许AI访问文件、代码、浏览器等工具,实现更强大的协作。
站内正文

维多利亚州宣布新的社交媒体“去匿名化”权力,针对被指控诽谤的账户

根据维多利亚州拟议的新法律,社交媒体和AI平台可能被迫识别被指控在线诽谤的匿名用户。州长杰辛塔·艾伦宣布了一系列改革,称家庭需要新方式来保护儿童上网。

  • 新法律将赋予VCAT权力,强制社交媒体和AI平台识别被指控诽谤的匿名用户。
  • 州长杰辛塔·艾伦强调改革旨在保护儿童免受在线伤害。
站内正文

律师因未使用人工智能可能面临诉讼

英国司法管辖区工作组(UKJT)发布法律声明,警告律师及其他专业人士可能因未使用人工智能而面临过失索赔,同时也可能因不当使用AI而被追究责任。现有英国法律足以判定相关责任,无需专门立法。

  • UKJT声明指出,专业人士不仅可能因滥用AI承担责任,还可能因未能采用AI而承担责任,前提是同行合理人士会使用。
  • 示例包括律师未使用AI辅助文件审查、放射科医生未使用AI识别肿瘤、审计师未使用AI检测异常。
站内正文

中国打击AI伴侣,迫使数百万用户与虚拟伴侣分手

中国出台新规,禁止科技公司向未成年人提供AI或虚拟伴侣,并要求平台限制用户过度使用、禁止聊天机器人鼓励情感依赖。此举旨在阻止现实人际关系的弱化,并试图扭转持续下降的出生率。字节跳动、阿里巴巴和腾讯等科技巨头已宣布关闭个性化AI伴侣聊天功能,数百万用户被迫与虚拟伴侣告别。

  • 新规禁止向未成年人提供AI伴侣,并限制所有聊天机器人鼓励情感依赖。
  • 中国政府担忧AI伴侣会导致年轻人逃避现实婚姻和生育。
站内正文

提示注入攻击正在挫败AI黑客代理

研究人员发现,通过在AWS上部署的密码和密钥旁放置提示注入,可以有效地阻止AI黑客代理的攻击。这种称为“上下文炸弹”的技术迫使LLM触发拒绝机制,从而停止恶意操作。测试显示,该技术将完全账户管理员访问从57%降至5%。

  • 攻击者利用提示注入诱导LLM执行恶意操作
  • 防御者开始在敏感数据旁放置提示注入以触发AI拒绝机制
站内正文

AI作为正常技术

本文提出将人工智能视为一种正常技术的愿景,反对关于超级智能的乌托邦和反乌托邦叙事。作者认为,AI是人类可以控制的工具,其变革性影响将在数十年内逐步显现,政策应侧重于韧性和减少不确定性,而非基于超级智能恐惧的激进干预。

  • AI应被视为一种可控的正常技术,而非超级智能实体。
  • 高风险领域AI的采用因安全和监管限制而缓慢。
站内正文

Flightwake – AI编程代理的飞行记录器,而非导航仪

Flightwake 是一个超轻量级的工作记录框架,专为强大的 AI 编程代理(如 Claude Code、Codex 和 Gemini)设计。它使用纯 Markdown 和 git 捕获决策、陷阱和会话记录,确保会话间平稳切换,无需导航。只需一条命令即可安装,并与 Claude Code 及其他代理集成。

  • 将工作会话、决策和陷阱记录为 Markdown 文件,存储在 git 中。
  • 事件驱动:仅在事件发生时才记录(例如 /fw-record、/fw-trap)。
站内正文

更新知识产权法规以应对AI蒸馏

本文探讨了版权法在AI蒸馏中的适用性,分析了蒸馏对创新的影响,并提出了四种可能的法规立场。作者认为版权法不适用于模型训练,呼吁社会就该问题达成共识,避免美国AI公司单方面制定规则。

  • 版权法并非自然法则,而是为鼓励创新设立的人为制度。
  • AI蒸馏涉及通过模型输出训练新模型,现有版权法难以适用。
站内正文

AI泡沫与互联网泡沫破裂:历史重演

本文探讨了当前人工智能领域的投资热潮与20世纪末互联网泡沫的相似之处,指出历史可能正在重演,警示投资者警惕过度投机。

  • 当前AI投资热潮与互联网泡沫存在诸多相似点
  • 过度投机可能导致市场崩溃
站内正文

SafeAI:面向AI代理的开源静态风险分析工具

SafeAI 是一款静态分析工具,专为AI应用源代码设计,用于检测安全风险、能力暴露和治理缺口。它完全离线运行,不执行代理或调用LLM,可集成到CI/CD管道中。支持8种AI框架,识别多种能力(如shell执行、文件系统访问等),并生成SARIF、JSON、HTML等格式报告。

  • SafeAI 在开发早期静态分析AI代理代码,发现能力暴露和风险
  • 支持LangGraph、CrewAI等8种框架,检测提示注入、工具滥用等
站内正文

市长曼达尼:房东不得使用AI图像发布出租广告

纽约市长佐兰·曼达尼发布《租赁欺诈报告》,要求房东和中介在租房广告中披露是否使用AI生成或编辑的图像。此举旨在打击虚假房源广告,保护租客权益,并将推动租户工会合法化、扩大租客谈判权等措施。

  • 纽约市长曼达尼发布报告,要求房东披露AI修改的房源图片。
  • AI生成的虚假房产图片问题日益严重,尤其影响远程签约租客。
站内正文

AI助力漏洞赏金:VulneraMCP

本文介绍了VulneraMCP,一个基于ZAP的AI增强安全测试平台,通过集成机器学习实现自适应漏洞检测和自动化工作流。系统利用ZAP的REST API进行核心扫描,并通过MCP协议连接AI代理,结合来自HackTheBox、PortSwigger学院等的训练数据,动态生成有效载荷,显著提升检测准确性和效率。作者Telmon Maluleka详细阐述了架构、组件、工作流程及实际效果。

  • VulneraMCP将ZAP扫描引擎与AI学习相结合,实现高级漏洞猎捕
  • 系统架构包括ZAP集成层、MCP代理层、学习引擎和数据库
站内正文

ADA:一款基于CSV和Excel的AI商业智能软件(不止于LLM)

ADA 是一个开源自动数据分析工具,用户上传 CSV 或 Excel 文件后,可自动清洗、检测业务模式、生成交互式仪表盘、标记异常、预测趋势,并支持自然语言提问,所有计算过程透明可见。无需 API 密钥即可使用,数据不离开本地。

  • 零配置分析:上传即可获得仪表盘、异常检测和预测
  • 透明计算:每个答案都显示其计算过程
站内正文

杰克·康特:为什么我(有点)不担心AI [视频]

Patreon首席执行官杰克·康特在一段视频中分享了他对AI影响的看法,他认为虽然AI带来挑战,但人类创造力和社区能保持优势,因此他并不完全担忧。

  • 杰克·康特认为AI无法取代人类的情感连接和社区价值。
  • 他强调创作者经济中的人性化因素仍至关重要。
站内正文

首个面向智能体的工业运营基准测试

SolarBench 是首个评估 AI 智能体在工业运营中能力的基准测试,专注于太阳能电站管理。模拟真实运营桌,包含警报、遥测、工单、零件库存和通信。最佳模型 Claude Fable 5 在约 54% 的任务中成功,但成本常为最优值的数倍。研究表明,模型在概率决策和信息优先级排序方面仍与人类专家有显著差距。

  • SolarBench 是首个针对工业运营的 AI 智能体基准测试,专注于太阳能电站管理。
  • 模拟持续一周,评估智能体处理警报、维修和零件订购的能力。
站内正文

20美元的AI编程订阅到底能买什么?

通过Tailscale的Aperture网关追踪Claude Pro订阅的令牌消耗,揭示看似固定的月费背后隐藏的真实成本。从一句问候的31美分到开发游戏的3.29美元,再到复杂项目的32.76美元,文章展示了轻量用户如何补贴重度用户,并探讨了Aperture在成本追踪、模型选择、防护栏等方面的功能,以及理解自身使用模式对应对未来价格调整的重要性。

  • 使用Aperture可追踪每次请求的令牌消耗,从而了解订阅的真实成本。
  • 一个简单的问候请求花费0.31美元,而开发一个简易游戏花费3.29美元,复杂项目甚至超过月费。
站内正文

软件开发者的消亡

文章探讨了数字平台中所有权与订阅模式的演变,以及LLM(大语言模型)对软件开发行业的潜在影响。作者认为,正如当前媒体和软件被平台垄断并转变为订阅服务一样,未来LLM驱动的软件开发也可能导致开发者沦为消费者,进一步巩固科技巨头的控制。

  • 数字平台通过DRM和订阅模式剥夺用户所有权,类似趋势正蔓延至软件开发。
  • LLM可能使开发者从生产者变为消费者,支付给AI提供商来生成代码。
站内正文

AI新政治捐助阶层已超越上一代科技巨头

Anthropic和OpenAI的员工在政治捐款上的参与率和金额远超谷歌、Facebook和Airbnb在IPO后的同期水平。他们的协调捐款聚焦于支持AI安全立法的候选人,并已在联邦和州选举中产生影响。这些捐助者主要集中在旧金山,正在为长期政治影响力奠定基础。

  • AI实验室员工的捐款率高于谷歌、Facebook和Airbnb在IPO后的同期水平。
  • 捐助者通过在线论坛协调捐款,以最大化对AI安全候选人的影响。
站内正文

比免费更好:在人工智能时代如何差异化

凯文·凯利(Kevin Kelly)在其经典文章《比免费更好》中,讨论了当复制品变得免费且充足时,创作者如何通过销售无法复制的事物——即“生成性”价值——来维持生计。他提出了八种“生成性”价值:即时性、个性化、解读、真实性、可访问性、实体化、赞助和可发现性。这些价值在人工智能时代依然适用,甚至更加重要。

  • 当完美复制品免费时,创作者需要销售无法复制的东西。
  • 凯文·凯利提出了八种“生成性”价值,如即时性、个性化、解读等。
站内正文

研究沙箱在AI控制中的作用

一项关于AI沙箱控制的研究表明,虽然整体安全性和实用性未见显著改善,但基于“最小权限”原则的“请求网站”权限模型在定性证据上表现最佳,有望在未来得到持续应用。

  • 沙箱通过限制攻击面来增强AI安全性,但仅当它阻止原本会绕过监控的攻击时才有效。
  • “请求网站”模型要求AI代理先申请特定网站权限,由可信模型审批,遵循最小权限原则。
站内正文

PrimeTask:一款离线优先、支持自带AI(MCP)的工作操作系统

PrimeTask是一款一次性购买的桌面应用,集成了任务、项目、CRM、日历、专注模式和可视化画板,全部离线优先。它通过MCP标准支持自带AI,用户可连接偏好的AI模型。该应用强调数据所有权和隐私,无需订阅。

  • PrimeTask集成了任务、项目、CRM、日历、专注模式及视觉画板等全方位功能。
  • 采用离线优先架构,本地存储数据,一次性付费永久使用。
站内正文

Build:Roblox上的移动优先AI创作工具

Roblox宣布推出“Build”,这是一款集成在Roblox应用中的移动优先AI创作工具,用户可以通过文本提示生成基础游戏。结合Studio中的新AI工具,旨在降低创作门槛,让任何人都能轻松构建游戏。测试将于7月28日在新西兰启动,随后逐步推广。

  • Roblox宣布推出移动优先的AI创作标签“Build”,用户可通过文本提示生成游戏
  • AI模型基于大量3D数据训练,可生成功能性3D物体和场景
站内正文

AI正在破坏求职面试

一段视频探讨了人工智能如何改变求职面试过程,并可能带来负面影响。

  • 人工智能在招聘中的使用日益增多
  • 可能导致面试过程缺乏人性化
站内正文

KDnuggets 每周综述:2026年7月13日周

本周精选包括如何用注册表模式替代If-Else链、降低LLM延迟和推理成本的12种方法、五个真实SQL项目构建数据作品集、Git Worktrees用于AI开发、用Outlines进行结构化语言模型生成、七个用于编排本地AI代理的Python框架、10个保持AI前沿的YouTube频道、Conductor for Gemini CLI入门、五个免费资源学习Agentic AI以及Pi编码代理的工作方式。

  • 用注册表模式替代if-else链可提高代码可扩展性
  • 降低LLM推理成本需优化令牌使用、模型路由和多层缓存
站内正文

Bound – AI智能体的确定性控制框架

Bound是一个轻量级的确定性控制框架,用于AI编码智能体,帮助它们在执行过程中决定何时接受、重试、重新规划或回滚,从而避免不必要的过度优化和回归问题。

  • 基于可观察证据的确定性决策:接受、重试、重规划、回滚
  • 无需LLM判断,通过预设标准和证据映射实现控制
站内正文

AIpine – iPhone上AI工件的瑞士军刀

AIpine是一款专为iPhone设计的应用,用于查看、预览和组织AI生成的各类文件,如JSX、HTML、Mermaid图表、SVG等,支持离线使用,无账户和云服务,保护用户隐私。

  • AIpine提供对AI生成文件的预览和源代码查看,支持多种格式。
  • 应用完全离线工作,文件存储在本地,无需账户或云服务。
站内正文

为什么AI公司的logo看起来像屁眼?

AI公司的logo普遍采用带有中心开口的圆形渐变色设计,被调侃为像肛门。文章分析了这种现象背后的设计心理学、生物模仿和跟风效应,并回顾了科技设计的潮流演变。

  • 许多AI公司logo具有圆形、渐变和中心开口特征,被戏称为“肛门风格”。
  • 这种现象源于圆形带来的安全感、无意识的生物模仿以及行业跟风。
站内正文

主题导航

政策 — AI 话题新闻 | AI News Hub