本論文では、連続局所探索(CLS)に基づくGPU加速疑似ブール充足可能性ソルバーAccelerated Fourier SAT (AFSAT)を紹介する。AFSATは概念実証アプローチFastFourierSATを完全にエンジニアリングされたソルバーへと発展させ、単一の問題インスタンス内で任意の異種対称制約タイプと長さの混合をサポートする。JAXコンパイラを利用し、純関数合成、自動ベクトル化、自動微分、ジャストインタイム(JIT)コンパイルにより、候補割り当てのバッチにわたって大規模並列CLSを実行する。概念実証と比較して、数値安定性、実行時性能、メモリ効率が大幅に向上したことを示す。これは、メモリレイテンシと浮動小数点表現から生じる様々な制限を特定し対処するとともに、自動並列化とコンパクト表現を活用することで達成される。浮動小数点の本質的な表現と安定性の制限は、カスタマイズされた離散フーリエ変換実装によって部分的に対処される。JAX配列シャーディングにより、複数のアクセラレータへのスケーリングでほぼ線形のスループットを達成する。
AI ニュース速報
リアルタイム監視
最新ニュース
信頼できる情報源、出典、権限、サイト内閲覧を保ちながら、AI の変化を読める情報に圧縮します。
最新ニュース
本論文は、AI研究がモデルを静的な成果物として事後分析するのではなく、訓練中にモデル行動が生まれる動的プロセスを研究すべきだと主張する。予測、介入、設計という段階的な理解を目指し、スケーリング則を損失から能力・バイアス・安全性へ拡張する課題を提起する。
CARVE-Qは、自動運転における拒否された操作の認証付き修復のための新しい量子-AIハイブリッドアーキテクチャです。量子最小探索を使用して修復列挙を高速化し、安全認証を古典領域に保持することで、証明可能な高速化と100%のコンプライアンスを実現します。
新しい研究により、攻撃者が攻撃タイミングを戦略的に選択できる場合、AI制御評価の実測安全性が大幅に低下することが示された。研究者らは攻撃決定を開始ポリシーと停止ポリシーに分解し、BashArenaとLinuxArenaの両環境で、1%の監査予算において安全性が20~28パーセントポイント低下することを実証した。既存の評価は安全性を過大評価している可能性があり、より現実的な評価のために攻撃選択を組み込むことを推奨している。
大規模言語モデルは数学的推論において顕著な進歩を遂げているが、既存のベンチマークは通常、最終的な答えや完全な証明を伴う明確に定義された問題を評価するものであり、協力的なオープンプロブレム解決を捉えていない。本論文では、MIT PRIMES-AoPS CrowdMathプログラム(2016-2025年)から得られた164件の専門家注釈付き進行チェーンからなるデータセットCrowdMathを紹介する。各チェーンは、オープンプロブレムの提示から証明完了までの複数参加者によるフォーラム議論を追跡し、投稿は機能的な役割に基づいてラベル付けされる。6つの最先端モデルを評価した結果、次投稿予測では83-88%の精度を達成したが、投稿役割分類では最良モデルでもマクロF1=0.42と低迷し、協調的な数学的進行の理解におけるギャップが明らかになった。
本論文は、依存型形式言語Lean4を使用してLLMエージェントの動作をモデル化し検証する初めてのフレームワークLean4Agentを提案する。FormalAgentLibライブラリとLeanEvolve最適化ツールを含み、実験では検証に合格したワークフローは不合格よりも平均11.94%優れており、LeanEvolveによってソフトウェアエンジニアリング性能がさらに7.47%向上した。
数独解法における学習ベースソルバーの正しさの保証の欠如と、記号的ソルバーのロングテール探索の問題に対処するため、研究者らは拡散モデルを用いた分岐選択手法DiBSを提案した。DiBSは記号的ソルバーの完全性を維持しつつ、拡散モデルで候補値をランク付けし、探索コストを大幅に削減する。Royle 17ヒント数独ベンチマークでの実験では、ノード数、バックトラック数、ロングテールパーセンタイルが改善され、困難な問題に対する学習済みグローバルガイダンスの有効性が示された。
本論文では、機械学習におけるバイアスを対称性の破れとして形式化し、損失ベースの正則化により対称性を回復する手法を提案。合成データセットにおいて90%以上の違反削減を達成し、精度低下は約5%にとどまる。因果グラフの知識は不要で、計算負荷が軽く、ビットフリップで定義可能な任意のセンシティブ属性に一般化できる。
Cerebroのホワイトペーパーは、企業そのものをインフラとして実装することで、小規模オペレーターがAIネイティブ企業を運営できると提唱しています。メモリ、意思決定、ワークフロー、エージェント、モデル、ガバナンスのすべてがバージョン管理され、検査可能で、オペレーターが所有します。これは、Claude Code向けのオープンソースOpsスキャフォールドであるLibroのコンパニオン文書です。
本記事では、Claude Codeのカスタムステータスラインスクリプトを紹介します。コンテキスト使用率、トークン数、コード変更量、レート制限の残り容量をリアルタイムで表示し、開発者が予期せぬ制限に遭遇するのを防ぎます。
NVIDIAとLGグループは、ロボティクス、自動運転、データセンター技術、GPUクラウドサービスにわたるLGのAI駆動ビジネスを加速するため、AIファクトリーを建設する。両社はNVIDIAのフルスタックAIファクトリープラットフォームとLGの家電、ロボティクス、モビリティ部品における世界的リーダーシップを統合し、物理AIシステムのための統一ワークフローを構築する。
TeardownHQ は、インディーSaaS創業者向けに検証済みの収益データと深層リサーチのプレイブックを提供し、スタートアップの成長をチャネル、価格設定、Go-to-Market戦略の観点から詳述します。ディレクトリは無料、完全なティアダウンは有料です。最初の500人にはファウンディングメンバー生涯契約が利用可能です。
Solarch は AI を活用してインタラクティブな図を作成し、コードとの同期を常に保ちます。
Preseason.ai は、初心者からエキスパートまで、さまざまなレベルのコーディングプロンプトに対してAIモデルがどのツールを選択するかを追跡するオープンソースのベンチマークです。プラットフォームは、高度なシナリオごとにツールをランク付けし、人気のあるオプション間の直接比較を提供します。
PandaProbe Cloudは、完全マネージドのエージェントエンジニアリングプラットフォームです。
アクセス、安全性、共有された繁栄に焦点を当てたAIの未来へのビジョン。OpenAIはAGIがすべての人に利益をもたらすよう取り組んでいます。
OpenAIは、アクセス、安全性、共有される繁栄に焦点を当てたAIの未来像を描き、AGIがすべての人に利益をもたらすよう取り組んでいます。
学生がAIチャットボットを過度に使用してエッセイを書いている問題を指摘。将来的に専門家に不可欠なスキルが欠如し、社会に悪影響を及ぼす可能性について論じる。
EMILIAProtocolは、高リスクワークフローにおける信頼評価と事前の信頼執行のための、ポータブルでベンダーニュートラルなプロトコルを定義します。信頼レシート、信頼プロファイル、信頼判断などのコアオブジェクトと、ハンドシェイクおよびアカウンタブルサインナフ機構を用いて、特定のアクションが許可されるべきかどうかを判断します。
AIコードスティッチャーは、AI生成コードを既存のコードベースにインテリジェントに適用するオープンソースツールです。最新のv1.74では、自動更新とインポートの巻き上げが導入され、自律型AIエージェントよりもユーザーコントロールを優先する哲学が強化されています。
Appleは、5つのモデルからなる第3世代Foundation Modelsファミリーを発表しました。Googleとの協力で開発され、オンデバイスモデルとサーバーベースモデルを含み、プライバシーと新しいアーキテクチャに重点を置いています。これらのモデルは新しいSiriやインテリジェントツールを駆動し、評価で大幅な品質向上を示しています。
OpenAI は AI が雇用、生産性、経済に与える影響を研究するために Economic Research Exchange を立ち上げました。現在、選定された研究プロジェクトの応募を受け付けています。
OpenEnvは、ターミナル、ブラウザ、またはエージェントが操作できる環境を作成するためのツールです。本日、OpenEnvがさらにオープンになり、エージェントのトレーニングの未来をオープンソースにすることを発表します。本日より、OpenEnvはMeta-PyTorch、Reflection、Unsloth、Modal、Prime Intellect、Nvidia、Mercor、Fleet AI、Hugging Faceを含む委員会によって調整されます。このプロジェクトは、報酬フレームワークやトレーナーではなく、RL環境のための相互運用性レイヤーに焦点を当てています。
matchmindはAIを活用した求人マッチングツールで、毎朝6時に5つの求人ボードをスキャンし、あなたのプロフィールに基づいてスコアリングした上位10件の求人をメールでお届けします。GPT-4を使用して職務経歴書を分析し、評価と説明を提供します。また、フィードバックループにより学習が進みます。
Simon Willison が datasette-agent-edit 0.1a0 をリリース。これは Datasette Agent プラグイン向けのストレージに依存しないファイル編集ツール(view、str_replace、insert)を提供するベースプラグインです。
本記事は「AIが弁護士を置き換える」という見解を否定し、法律業務は固定量ではないと論じる。ジェボンズ効果、対抗的なダイナミクス、バウモルのコスト病を通じて、AIはむしろ法律サービスの需要を増加させ、仕事を減らすどころか増やすと主張する。
この記事では、AIが著作権法の経済的論理をどのように変えるかを探る。歴史的に、著作権はアイデアではなく表現を保護してきた。なぜなら、最初の表現にはコストがかかるからだ。AIは表現を安価にし、アイデアや趣味、判断力を相対的に価値あるものにする。筆者はラファエロのタペストリーの例を用いて、複製コストの変化が著作権の必要性にどう影響するかを説明する。
NVIDIAと斗山グループは、ロボティクス、建設機械、エネルギー、材料などにわたり、物理AIとAIファクトリーインフラの新たな機会を推進するため協業を拡大しています。
2024年、仮名をMeida Marekとする新卒の女性が金融業界のエントリーレベル職に就きながら、AIが自分より仕事をこなせるようになったらどうなるかと考え始めた。
本稿は、調達におけるAI活用時のリスクの帰属について考察する。著者は、リスクは常に人間が負い、AIは助言的な存在に過ぎないと主張する。調達の本質は最適化だけでなく、複雑な人間関係や不確実性への対応にある。説明責任の線は資本規模に応じて変化するが、リスクの所有権は常に人間にある。