Amazon SageMaker HyperPodで実現する Amazon Novaの複数ターンRL基盤構築
・企業向けエージェントが複数ステップのワークフローを実行する際、単一アクションの品質が後続ステップに依存する訓練課題が発生 ・強化学習(RLHF)を複数ターン対応させ、データベース照会やAPI呼び出し、エラー回復を含む実務的なタスク学習を実現 ・Amazon SageMaker HyperPodのスケーラブルインフラで、大規模モデル訓練の効率化と導入時間短縮を両立
Archive 記事を横断検索
キーワードだけでなく、業界・用途・情報種別・公開時期を組み合わせて検索できます。気になるテーマから、自社で試すヒントまでまとめて辿れます。
← AI Intel トップに戻る2 / 4ページ
・企業向けエージェントが複数ステップのワークフローを実行する際、単一アクションの品質が後続ステップに依存する訓練課題が発生 ・強化学習(RLHF)を複数ターン対応させ、データベース照会やAPI呼び出し、エラー回復を含む実務的なタスク学習を実現 ・Amazon SageMaker HyperPodのスケーラブルインフラで、大規模モデル訓練の効率化と導入時間短縮を両立
・Hugging Face と Amazon SageMaker AI の統合により、モデル発見から実験までをワンクリックで実現 ・開発者は Hugging Face 上でモデルを選択し、SageMaker Studio で即座にファインチューニングや検証を開始可能 ・ファウンデーションモデルの開発サイクルを短縮し、プロトタイプから本番運用への移行を加速
・2023年創業の Mistral AI はオープンソース AI モデルを提供し、フロンティア AI を誰もが使える状態にすることを目標としている。 ・同社は創業以降、大型資金調達を複数回実施し、OpenAI との競合企業として成長している。 ・オープンソースアプローチにより、商用製品と異なり、企業が自社環境での導入・カスタマイズが可能な選択肢を提供している。
・Midjourneyは係争中のハリウッドスタジオ3社に対し、AIの利用実態を開示するよう要求している ・法的紛争の一環として、スタジオ側のAI使用方法の詳細を明らかにさせようとしている ・生成AIと映像制作業界の権利関係が法的に問われている段階
・Transformer が次トークン予測と将来予測用の状態保持を同じ計算経路で行う点に着目し、これらを分離することで性能向上が期待できるという仮説を提示 ・状態保持と予測の役割を分離した新型Transformer 変種を設計し、複数スケールでの事前学習実験を実施 ・分離アーキテクチャが言語モデリング性能の向上をもたらすことを実験的に示唆
・LLMが研究アイデア出しに使われる場面が増えているが、既存評価は新規性や実現可能性の個別判定に留まっている。 ・本研究は「LLM生成アイデアが人間研究者のレベルにどこまで近いか」という問いに直結する評価フレームワークを提案。 ・高品質な人間の研究論文から逆算して先行研究を特定し、LLM出力との系統的な比較を可能にした。
・大規模言語モデル(LLM)は数字選択などで高い予測可能性を示しており、創造性が低い傾向にある。 ・複数の主流チャットボット(Claude、ChatGPT、Gemini)で同様の「思考の溝」に陥っている実態が指摘されている。 ・スタートアップがこの制約を突破するための方法論の開発に取り組んでいる。 ・LLMの多様性と創造性向上は、エンタープライズ導入時の差別化要素となる可能性がある。
・楽曲全体の生成において、ボーカルと伴奏の協調性と音声品質のバランスを取る技術的課題に対応 ・混合トークン方式と双トラック予測の長所を組み合わせたハイブリッドアプローチを採用 ・言語モデルと拡散モデルを融合させた LeVo 2 フレームワークにより、歌詞・プロンプト指示への追従と一貫性の維持を実現
・Transformerモデルの長文脈処理を効率化するため、一部層を完全注意機構で保持し残りを線形注意機構に置き換えるハイブリッド構造が有効である ・従来手法は層の重要度を独立して扱うヒューリスティック(固定パターンや層別スコアリング)に依存していた ・層選択の最適化が変換成功の鍵となり、新たな選択戦略の研究が進行中である
・MIT が 2024 年秋に開設した音楽技術・計算大学院プログラムが初の研究発表会を開催 ・人文科学系と工学系の学部横断型で、音楽と AI・計算機科学の融合を推進 ・修了生らが AI 作曲、音声処理、インタラクティブシステム等の研究成果を展示 ・業界と学界の連携強化により、音楽テック分野の人材育成と技術開発が加速
・LLMエージェントの長期行動評価において、プロセス報酬モデル(各ステップを評価)の構築は人間アノテーションやシミュレーションが困難であった課題に直面。 ・本研究は、RL(強化学習)ポストトレーニングのプロセスそのものが、別途の報酬モデル構築なしにステップレベル評価を可能にすることを示唆。 ・長期相互作用、不可逆的アクション、確率的環境フィードバックを含む複雑なエージェントシナリオへの適用を想定。
・GoogleのトップAI研究者Jonas AdlerとAlexander Pritzelが相次いでAnthropicに転職。 ・これまでNoam ShazeerやJohn Jumperなど複数の著名研究者がGoogleを離職している状況が続いている。 ・有力AI人材の流出は企業の研究開発競争力に直結する重要な経営課題。
・エージェント型言語モデルの学習データ作成方法が未公開のため、OT-Agent プロジェクトが完全オープンなデータ準備パイプラインを提案 ・既存の SWE-Smith、SERA、Nemotron-Terminal などは単一ベンチマーク対応で、複数の異なるエージェントタスクに汎化するモデル開発の課題が残存 ・複数の多様なエージェントタスク領域にわたって学習可能なデータセット構築手法を公開することで、エージェント型 AI の開発障壁を低減
・マルチモーダル大規模言語モデル(MLLM)に推論とコード実行を組み合わせる研究が急速に進展している ・既存手法は視覚認識タスクに特化し、定義済みルールに依存するため数値計算に対応できない限界がある ・AIRは視覚操作と数値計算の両方に対応可能な適応的なアプローチを提案している
・テキスト指示から画像を生成するAIモデルは、指示への忠実性は高いが、生成結果が単一の解釈に偏る多様性の課題を抱えている。 ・既存の多様性改善手法は、意図的な設計選択ではなく偶然的な変動を利用しているため、有用性が限定的。 ・本研究は生成サンプルに構造を強制した上で、ユーザーが意味のある選択肢から多様な結果を選べる制御可能な方法を提案。
・生成AIの推論エンドポイント運用時の監視・トラブルシューティングの課題を解決するAWS機能 ・P99レイテンシ急増時の根本原因(GPU メモリ圧力、KV キャッシュ飽和、トラフィック不均衡、オートスケーリング遅延など)を迅速に特定可能 ・SageMaker の詳細メトリクスと CloudWatch Insights ダッシュボードで、大規模 LLM エンドポイントの運用効率を向上
・既存の複数話者対話システムは構造化された教師データ(話者タグ、複数トラック文字起こし等)に依存し、音声のみを抽出する ・ScenA という手法は、大規模な実録音データで事前学習したテキスト音声生成モデルを、参照音声で条件付けし、環境ノイズを含むリアルな会話シーンを生成可能にする ・従来の教師データ依存から解放され、野生環境での実録音パターンに基づいた自然な多話者音声シーンの合成が実現できる可能性がある
・テキストから音楽を生成する AI の出力品質を、人間の好みに基づいて評価するモデル「TuneJury」を開発・公開 ・対戦形式の投票、クラウドソーシング比較、専門家評価など複数の人間評価データを学習し、2 つの音楽の好ましさ差をスコア化 ・公開チェックポイントの提供により、音楽生成 AI の改善評価が標準化・再現可能に
・1981年の古典的研究では、自然画像はフーリエ変換の位相情報のみで認識可能だが、大きさ情報は識別に寄与しないことが示された。 ・本研究では、訓練済みの画像分類器(PRISM2D、GFNet、ViT-B/16など)が隠れ層内でこの非対称性を再現するか因果的に検証する手法を提案。 ・2つの画像の位相と大きさを入れ替えて、分類器がどの画像に追従するかを測定することで、ニューラルネットワークの内部表現メカニズムを解明。
・LLMベースのエージェントシステムは順序立てたテキスト入力に依存するため、複数タスクを並列実行する現代的なワークフローとの不整合が生じている ・既存システムは並列ブランチの出力をテキスト連結して統合するため、構造情報が失われ処理効率が低下する ・潜在空間(LLMの内部表現)で直接ブランチを合成する新手法により、並列構造の情報を保持したまま統合可能になる見込み
・ビジョン言語モデル(VLM)が画像を説明する際、特定の注意機構「視線ヘッド」を発達させていることを発見。・この視線ヘッドは、モデルが現在説明している画像領域に注意を集中させる機能を持つ。・漫画などの制御可能なテストベッドを使い、わずかなフォワードパスで視線ヘッドを同定する方法を提案。・VLMの内部動作メカニズムを可視化し、モデルの信頼性向上に寄与する知見。
・従来の意味的類似性に基づく検索では、複雑な推論タスクに対応できない問題を指摘。 ・RA-RFTという手法を提案。表面的には異なる問題でも同じ推論パターンを持つケースに対応。 ・言語モデルが類似する問題から解法パターンを学習し、推論精度向上を実現。
・現代の大規模言語モデル(LLM)は、学習データ生成・フィルタリング・評価の各段階で他のモデルに依存している ・これらの依存関係は再帰的で、複数のリリースと文書にまたがり、全体像を把握することが困難になっている ・公開されている各種の成果物から依存構造を追跡することは、複雑性と深さから人間による確認が実質的に不可能な状況に直面している ・LLM の透明性と信頼性向上のため、こうした見えない依存関係を体系的に監査・記録する必要がある
・大規模モデル学習では、データ並列・パイプライン並列・エキスパート並列とZeROなどの省メモリ化を組み合わせる必要があり、専門家による設計・実装が適応の負担になっている。 ・Piperは戦略と実行基盤を分離し、少数のモデル注釈とスケジューリング指示から、計算と通信を表す統合DAGを介してデバイス別の実行計画を生成する。 ・論文ではZeROなど既存戦略で同等性能を保ちつつ、計算と通信の共同スケジューリングにより、DualPipeのような複...