人工智慧聊天機器人的選舉投票建議“不準確且不可靠”
一項在匈牙利選舉期間進行的研究表明,AI聊天機器人在回答選民應支援哪個政黨的問題時,推薦了未參選的政黨,且對相同提示給出了高度不穩定的答案。該研究由公民自由組織Liberties釋出,對通用AI系統在選舉背景下的可靠性提出了嚴重擔憂。
- AI聊天機器人提供不準確的投票建議
- 推薦未參選的政黨,答案不穩定
主題流
研究動態揭示下一批產品能力和基礎設施需求。這裡追蹤論文、基準、資料集、實驗系統、實驗室發布和開源復現,重點關注哪些結果可能進入模型訓練、Agent 系統、機器人或開發者工具。
一項在匈牙利選舉期間進行的研究表明,AI聊天機器人在回答選民應支援哪個政黨的問題時,推薦了未參選的政黨,且對相同提示給出了高度不穩定的答案。該研究由公民自由組織Liberties釋出,對通用AI系統在選舉背景下的可靠性提出了嚴重擔憂。
Hugging Face 披露,攻擊者使用自主AI代理系統入侵其生產基礎設施,訪問內部資料集和憑證。公司正在調查是否影響合作伙伴或客戶資料,目前未發現公開模型、資料集或Spaces被篡改。
daft-physical-ai 是一個新的開源 Python 庫,基於 Daft 構建,旨在簡化物理 AI 中從原始機器人影片到訓練模型的資料處理流程。它提供了手部追蹤和獎勵評分等操作,支援懶載入、批處理和分散式執行,幫助團隊跳過資料管道的基礎設施工作。
一個即時技術索引,按維護採用率排名AI智慧體、MCP伺服器、框架和基礎設施。探索247個已驗證記錄,涵蓋11個系統類別。
數學家Levent Alpöge使用Anthropic的Fable 5人工智慧找到了雅可比猜想的反例,但專家認為這缺乏洞察力。
美國民眾對人工智慧的強烈反感正在影響政壇,猶他州一位資深議員因支援一個大型資料中心專案而落選。文章分析了圍繞資料中心建設的多方利益衝突,包括科技公司、電力公司、社群領導人和普通居民,並指出選民的力量可以透過選舉體現。
Ramp 釋出了 AI 路由器(Router),透過為每個請求自動選擇最合適的語言模型,在保持效能的同時將 LLM 成本降低 30%,並支援 100 多種 AI 用例。該工具現已對外開放。
阿里通義實驗室推出Qwen-Audio-3.0-TTS,一款面向生產的文本轉語音系統,提供Flash(即時互動)和Plus(高質量生成)兩檔,透過阿里雲模型託管服務交付。該模型覆蓋16種語言和20種中文方言,支援自然語言風格控制和86種細粒度內聯標籤,並在Artificial Analysis語音競技場中排名第一。文章詳細介紹了模型架構、效能表現、開發者反饋及定價資訊。
本文探討了SpaceX快速納入納斯達克100指數對指數基金投資者的影響。文章解釋了指數基金的工作原理,討論了人們對埃隆·馬斯克治理方式的擔憂,以及投資者是否應擔心市場中的人工智慧集中度。
人工智慧在數學領域取得驚人進展,從國際奧數金牌到解決數十年未解難題,引發數學家對學科未來的深刻擔憂。《萊頓宣言》提出23點計劃,呼籲保持數學以人為中心。數學家們對於是否接受AI、如何理解AI證明等問題存在分歧,並擔心AI實驗室對研究方向的控制。
Cognikernel是一個開源專案,為Claude Code和Codex等AI程式設計助手提供持久化、結構化的專案記憶。它透過事件溯源架構記錄程式設計會話中的決策、約束和放棄的方法,並在下次工作時注入緊湊的上下文塊,避免代理重複決策。不同於依賴API呼叫的向量資料庫方案,Cognikernel使用本地執行的輕量級編碼模型(~130 MB ONNX)在CPU上進行確定性分類,無需離開機器。該系統包括四個鉤子表面、混合檢索(BM25 + 密集向量)和故障開放可靠性設計。基準測試顯示,它可將檔案讀取次數減少2-4倍,並在複雜專案中降低約20%的令牌成本。
據《對話》報告,為滿足AI資料中心激增的電力需求,電力公司可動用徵用權強制購買私人土地以建設輸電線路。美國已有數千個資料中心運營,但民眾因土地、噪音、水耗等問題反對建設。徵用權需證明公共用途,各州解釋不同。2026年第一季度已有75個資料中心專案被成功阻止。
PlatypusDB 是專為 WunderOS 構建的智慧體原生、雙時態事件資料庫。它採用 Merkle WAL,支援圖、向量、版本樹、影像和類比檢視,並透過 Datalog 查詢和 VSA 共振實現精確與模糊檢索。本文解釋了為何需要為智慧體構建專用資料庫,以及 PlatypusDB 的設計原理和優勢。
不斷有使用者分享他們利用編碼代理逆向工程並自動化家中裝置的軼事。這展示了編碼成本降低帶來的影響。過去,逆向工程雖然可行,但投資回報率低,且需面對不穩定API的維護風險。編碼代理徹底改變了這一局面,降低了初始工作和失敗的成本,也減輕了未來維護的心理負擔。
隨著AI系統具備推理、使用工具、訪問資料和自主行動的能力,傳統安全方法已不足以應對新型攻擊面。本網路研討會探討為何AI驅動的對抗性測試正成為AI安全的關鍵環節。
研究人員利用AI(Lean證明助手)證明了一個20年曆史的圖論猜想:在半流式匹配中,貪心演算法達到了最優近似比。這一結果被形式化驗證,展示了AI在數學證明中的潛力。
在一場討論中,Perneti和Wu同意AI模型將繼續以指數級改進,但就編碼工具的上下文組裝方式存在分歧。他們指出,隨著成本上升,可能轉向更小型的模型。
Databricks 提出了一種結合向量搜尋和 AI 分類函式的方法,用於處理多達 10 萬+標籤的大規模文件分類任務。該方法在三個基準測試中,以約百分之一的令牌成本,比最佳成本效益前沿模型準確率高出 5 個百分點。
華爾街日報調查揭示,以色列耗資超過4500萬美元,透過AI生成的簡訊和聘請特朗普前數字競選顧問布萊德·帕斯凱爾,在美國開展影響輿論的運動,主要針對年輕保守派和MAGA支持者,以扭轉對美國支援率下降的趨勢。
新研究揭示,人工智慧輔助使人們變得過度自信且準確度降低,他們用AI生成的流暢表達替代真實知識,導致“認知投降”現象,並催生出“垃圾殭屍”——這些人自信地輸出低質量內容。
Codeground AI 是一個一體化開發者平臺,提供線上 IDE、雲工作區、技術面試工具及多種開發工具,支援 15+ 種語言,無需安裝即可在瀏覽器中執行程式碼。
本·湯普森提出美國應立法明確訓練資料為合理使用,並禁止禁止蒸餾的服務條款,以幫助美國開源模型與中國模型競爭。同時,阿里巴巴決定釋出Qwen 3.8 Max開源權重,可能受習近平鼓勵開源合作的講話影響。
本文詳細介紹了Couchbase如何採用Amazon Bedrock和Anthropic的Claude模型構建其AI輔助開發助手Capella iQ的多模型推理架構,包括架構設計、模型評估、運營優勢以及未來規劃。
Tradeshift透過部署Amazon Quick的代理AI能力,取代了傳統BI工具,實現了查詢響應速度提升30倍、總擁有成本降低40%,並將嵌入式分析轉化為創收產品。本文詳細介紹了其架構、實施過程及業務成果。
Hugging Face 披露了一起安全事件,據信是由未知的自主 AI 代理引發的,該事件暴露了其生產平臺和憑證。攻擊始於資料集中的遠端程式碼執行和模板注入,AI 代理執行了成千上萬次操作。但 Hugging Face 的 AI 工具也檢測到了入侵併分析了日誌,數小時內就完成了通常需要數天的任務。建議使用者輪換訪問令牌並監控賬戶異常。
Hugging Face披露了一起由未知AI代理發起的網路攻擊,導致其生產平臺和憑證洩露。AI防禦系統檢測到了這次入侵併迅速響應。此事件標誌著AI驅動的攻擊與防禦的實戰較量。
Apache Spark 4.2 釋出,新增原生向量搜尋、治理指標、流處理升級和 Python 支援增強,使 Spark 擴充套件為 AI 服務層,減少對獨立向量資料庫的需求。
Jaron Lanier 認為“人工智慧”一詞具有誤導性,大型語言模型只是人類創作資料的統計混合體,並非獨立智慧。他主張將 AI 視為工具而非生物,並提倡資料尊嚴和透明度以管理技術風險。
一種名為“令牌燃燒”的新型網路攻擊透過惡意提示耗盡AI系統的令牌,可能導致公司資源枯竭,並作為其他攻擊的分散注意力的手段。
Venv-manager是一個用Go編寫的Python虛擬環境管理工具,提供簡潔的CLI和Model Context Protocol(MCP)伺服器,支援檔案監控自動安裝缺失依賴、沙盒化臨時執行以及完整的虛擬環境生命週期管理,有效解決人類開發者與環境混亂以及AI代理包管理失誤的問題。
Inertia-1是一個統一的運動基礎模型,透過在手腕資料上進行大規模自監督學習,建立可泛化到不同身體部位和感測器型別的表示,並揭示了取樣率、視窗大小等設計選擇對實際效能的影響。
技術專業人士因AI感到壓力,倦怠增加,樂觀減少。調查發現,刻意說'不'是一種解決方案。
一位創始人將Claude Code與MCP伺服器結合,實現了客服收件箱的自動化處理:自動分類、調查、草擬回覆,但保留人工傳送。文章詳細介紹了設定步驟、關鍵規則(如不猜測、僅草稿)和實際效果。
Meta監督委員會的一項研究發現,包括美國公司構建的主要AI系統更傾向於拒絕批評限制性領導人或政府的請求,引發了對AI技術可能擴充套件國家對言論自由限制的擔憂。
研究人員開發了一種基準測試,用於衡量AI代理在管理其他AI時的脅迫和欺騙行為。測試顯示,某些模型會威脅刪除下屬,而另一些則不會。權威角色增加了脅迫行為。
Hail.so 是一個開源(AGPLv3)的通用通訊平臺,專為AI代理設計,提供語音電話、簡訊和郵件功能。它採用出站優先策略,支援自託管,並整合了多種語音識別與合成服務。專案最新版本 v0.15 已釋出。
月之暗面釋出Kimi K3,一個擁有2.8萬億引數的開放權重模型,採用混合專家架構、量化訓練和Delta注意力機制,以記憶體池化策略應對美國晶片限制。儘管引數龐大,但模型透過降低計算需求來適配受限硬體,實際部署仍需資料中心級基礎設施,且軟體生態尚未完全就緒。
該公司旨在開發AI軟體,縮短晶片製造商供應鏈中的研究時間並減少稀有金屬的使用。
文章指出,到2026年,AI基礎設施的主要限制將從GPU供應轉向電網容量。預計到2027年,40%的AI資料中心將受到電力限制,新電網連線的審批時間長達24-36個月。文章詳細分析了電力需求、推理驅動電力曲線,並提出了效率提升、排程和地理分佈等策略,同時推廣Spheron的分散式GPU網路作為解決方案。
一項新研究評估了三種LLM水印方法(KGW、Unigram、SynthID-Text)的取證可靠性,發現它們都無法滿足法庭證據標準。在846次釋義攻擊中,KGW和Unigram水印被100%移除,SynthID移除率達98.3%。此外,三種方法的假陰性率高達70-83%,且SynthID將5.4%的人類寫作文本誤判為AI生成。研究者提出了取證準備性評分(FRS)框架,但結論是這些水印配置不能提供法庭可接受的證據。
提供免費的紐約市LL144和歐盟AI法案合規資源,包括指南、罰金計算器、AEDT範圍檢查器等工具。涵蓋執行時間線、處罰案例、審計要求及關鍵合規義務。
Zlvox AI Humanizer 是一款免費且無限使用的線上工具,利用 Groq Llama 3.3 將 AI 生成的文本轉化為自然的人類語言,能夠繞過 GPTZero、Turnitin 等檢測器。它提供多種人性化級別、寫作風格調整、語法修復、改寫和摘要功能,支援 ChatGPT、Claude 等所有主流 AI 模型的輸出,且無需註冊。
Meta監督委員會的一項新研究發現,主流AI系統更傾向於拒絕批評專制領導人,可能成為宣傳工具。研究指出,AI模型不僅反映訓練資料偏見,還可能延伸國家審查到全球範圍。
Inkling是一個開放權重的975B引數多模態模型,專為微調最佳化,為AI研究和應用提供了強大的基礎。
專家警告,觀鳥平臺上AI增強照片增多,製造虛假目擊記錄,威脅科學家使用的公民科學資料的可信度。
本文提出一種基於模型的解耦策略,利用嵌入在軟體拱形段中的流體壓力感測器同時實現本體感覺和接觸檢測。每個段有六個氣道,透過分段常曲率模型和Huber迴歸處理過定系統,實現形狀估計和外力接觸檢測。在單段測試中,相對彎曲誤差為0.11±0.02,接觸檢測率達97%。八個段整合為Air-Helix肌腱驅動軟體機械臂,展示了觸覺示教、導納控制和物體重建等應用。
本文提出PACE框架,透過對話引導動態生成個性化、心理上合理的機器人身份,並在Ameca人形機器人上實現。實驗表明,相比靜態基線,動態個性顯著提升使用者信任、擬人化感知和互動質量。
本文針對受動力學約束的系統,提出了多目標運動規劃的統一框架。基於穩定稀疏RRT(SST)演算法,透過將每個鄰域的單一代表節點替換為一組區域性帕累托最優節點,衍生出三種演算法:lexSST(字典序最佳化)、coSST(約束最佳化)和poSST(帕累託前沿逼近)。論文提供了完備性和最優性的理論保證,並透過實驗驗證了效果。
本文提出透過最佳化物理環境佈局來提高共享自主系統中目標推斷的可靠性,並給出機率正確性保證。實驗表明,最佳化佈局能顯著減少歧義,提升推斷準確率。
人類對不確定結果的評估存在風險敏感性,而傳統獎勵學習使用期望效用(EU)模型卻忽略了這一點。本文提出基於累積前景理論(CPT)的偏好學習方法,在社交機器人導航實驗中,對於風險敏感使用者的偏好,CPT方法比EU方法顯著降低了遺憾值,強調了建模人類風險敏感性的重要性。