合成データから人型ロボットの移動操作スキルを学習するVLKフレームワーク
・人型ロボットが視覚・言語命令・運動を統合して作業を実行する際、大規模な学習データが不足していた課題に対応。 ・3D再構成されたシーンで合成的に「ビジョン・言語・運動学」(VLK)の監督信号を生成するパイプラインを提案。 ・一人称視点の画像・自然言語命令・ロボット互換の運動軌跡を同期させた学習データを効率的に構築可能。 ・シミュレーション環境での大規模データ生成により、実機学習の前段階として活用できる基盤を確立。
Archive 記事を横断検索
キーワードだけでなく、業界・用途・情報種別・公開時期を組み合わせて検索できます。気になるテーマから、自社で試すヒントまでまとめて辿れます。
← AI Intel トップに戻る4 / 4ページ
・人型ロボットが視覚・言語命令・運動を統合して作業を実行する際、大規模な学習データが不足していた課題に対応。 ・3D再構成されたシーンで合成的に「ビジョン・言語・運動学」(VLK)の監督信号を生成するパイプラインを提案。 ・一人称視点の画像・自然言語命令・ロボット互換の運動軌跡を同期させた学習データを効率的に構築可能。 ・シミュレーション環境での大規模データ生成により、実機学習の前段階として活用できる基盤を確立。
・MIT建築学部出身の研究者による展示が、コンピューティングを建築・応用芸術の創造手段へ転換する20~21世紀の試みを検証。 ・哲学・数学・コンピュータサイエンス・デザイン計算の融合により、アルゴリズムと機械学習システムの理論を可視化。 ・データ駆動型設計の限界を問い直し、創造的判断の余地と美的価値をいかに組み込むかを再考する。
・HORIZONフレームワークがハードウェア設計をリポジトリレベルのコード進化として扱う新しいアプローチを提示 ・Markdownベースの仕様書をドメイン知識・評価器・受理判定ロジックを含むプロジェクトパックへ自動コンパイル ・AIエージェントがgit操作を用いて設計を反復的に進化させ、状態管理・追跡・再現が可能 ・従来のEDA(電子設計自動化)ツールの枠を超えた、自律的ハードウェア設計の自動化を実現
・ビジョン言語モデル(VLM)が視覚情報と学習済み知識の矛盾を解決する過程を、モデル内部の活性化レベルで分析した研究。 ・活性化パッチングと段階的なアブレーション実験により、矛盾発生時にVLMが視覚情報を優先する傾向(Vision-Default)と知識が優先される条件を明らかにした。 ・複数のVLMファミリーで検証され、マルチモーダルシステムの信頼性向上に向けた機械的な理解が進展。
・TIG溶接とレーザー溶接など異なる溶接方式間で、教師あり学習モデルの性能が低下する「ドメインシフト」問題に対応 ・ドメイン適応(UDA)フレームワークを用いて、ラベルなしデータで溶け込み深さ状態の自動判定精度を向上 ・異なる物理メカニズムを持つプロセス間でも、モデルの再学習コストを削減しながら予測性能を維持可能
・Vision-Language-Action(VLA)モデルは視覚・言語情報は強力だが、ロボットの物理的動作学習が弱い課題を指摘。 ・動作に関する事前学習済み知識(アクションプライア)を明示的に組み込む新しいアプローチを提案。 ・異なるロボット体型間での動作知識の転用可能性を高める研究。
・Vision-Language-Action(VLA)モデルが基本動作レベルで操作可能になることで、訓練データにない新しいロボット操作スキルを自動獲得できる仕組みを提案 ・デモンストレーションを自動分割し、プリミティブアクション(「グリッパーをボウルに移動」など)の組み合わせでスキルを再構成 ・ロボット学習の汎用性向上と、現場での継続的スキル拡張の可能性を示す研究
・ヒューマノイドロボットが歩行中に高自由度の手で器用に物体を操作する技術「CoorDex」を開発。従来の「歩く→止まる→操作→歩く」の分断的動作から脱却。・高次元の身体と手先制御を潜在空間の残差制御に統合し、移動しながらの複雑な操作が可能に。・機械学習パイプラインで、複数の先行知識を活用して効率的な学習を実現。・産業用ロボット・自動化設備での応用が期待される基礎研究。
・MIT開発の新型チップにより、小型無人機がLED程度の電力消費で3D環境マップをリアルタイム生成可能 ・HVAC配管内のガス漏れ検査など、狭い工業施設での障害物回避ナビゲーションに応用 ・バッテリー制約の小型自律ロボットが衝突回避の経路計画を実行でき、産業点検業務の効率化へ
・手動の空間アノテーションなしで、放射線科向けビジョン言語モデルの訓練方法を研究 ・独ドイツ語と英語の二言語対応、CT/MR画像120万枚とテキストペアのRefRad2Dデータセットを開発 ・LLMベースキュレーションと自動セグメンテーションで、VQAと空間グラウンディング部分集合を自動生成 ・RadGrounderモデルは報告書生成と視覚質疑応答を同時実行可能に構成
・OpenAIの推論機能を持つAIモデルを用いて、従来診断困難だった小児稀少遺伝病の診断支援に成功。 ・未解決ケースから18件の新規診断を実現し、臨床的な課題解決の可能性を示唆。 ・医学専門知識とAIの推論能力を組み合わせ、診断精度向上への道を開く。
・選好比較からの報酬学習において、報酬・動力学・価値関数の不確実性を統合的に考慮する能動的探索手法を提案 ・既存の受動的データ収集に比べ、特に学習初期段階でのサンプル効率を大幅に改善 ・モデルベースアプローチにより、報酬設計を明示的に行わずロボット制御や推奨システムなど複数領域での応用が期待される
・OpenAI がLifeSciBench という生命科学研究向けベンチマークを発表 ・専門家が問題設計と査読を担当し、実務的な研究タスク評価に対応 ・AI システムの生命科学分野での実用性を客観的に測定できるツール
・ロボット政策の生成器と視覚検証器を組み合わせたVERITASフレームワークを提案。推論時にロボットの行動を評価・操舵できます。・事前学習済みの汎用ロボット政策に勾配不要な視覚検証器を組み合わせ、リアルタイムで行動品質を判定。・ロボットが自身の経験から学習し、継続的に性能を改善する仕組みを実現。・推論時の自律改善により、再学習なしに環境変化への適応が可能。
・ゼロショット物体探索(訓練なしで目的物を探すロボットナビゲーション)において、従来の基盤モデルは静的な知識に依存し適応性に欠けていた。 ・EvolveNavは、テスト時に継続的に改善する自己進化フレームワークを提案し、エージェントの行動ルールをメモリに蓄積して学習。 ・事前反省メカニズムにより、試行錯誤のコストを削減しながら、環境適応性と探索効率を向上。
・MIT研究チームがロボット向けの長期記憶フレームワークを開発し、複雑で大規模な環境の詳細な空間的・時間的モデルを素早く形成・想起できるようにした。 ・従来ロボットは、人間が自然に行う「鍵をどこに置いたか覚えている」といった空間記憶の能力に劣っていた。 ・工場作業など人とロボットが協働する環境では、このような記憶能力がロボットの効率性と安全性向上に貢献する可能性がある。 ・研究はロボットの自律性向上と人間との協働作業の実現化に向けた基礎...
・MIT の新製造イニシアティブが発足1周年を迎え、800名以上の産業界リーダーや研究者が参加するイベントを開催。 ・工場内での AI 活用、スタートアップによるイノベーション導入、労働力不足への対策が主要テーマ。 ・大学と産業界の連携により、製造業における次世代技術と人材育成の推進を加速。
・Nature Portfolio掲載の442件の専門家キュレーション済みメタ分析データセット「MetaSyn」を開発 ・文献検索・研究選定・統計集計を含む系統的レビュー全体パイプラインの検証を可能に ・LLMエージェントの科学的推論能力を体系的に評価するベンチマーク基盤を提供 ・既存ベンチマークに欠落していた各段階の正解データを整備
・綿花の葉病を高精度で分類・検出するためのAIフレームワーク「CottonLeafVision」を開発・DenseNet201、InceptionV3、VGG19など複数の事前学習済みディープラーニングモデルを評価・説明可能性と堅牢性を備え、農業現場での実装を想定・綿花生産の経済的安定性向上に貢献する可能性
・複数の目標と異なる観測・役割を持つエージェント間の協調意思決定を扱うマルチエージェント強化学習の研究。 ・提案手法「PCMA」はエージェント固有の嗜好を学習し、複数目標間のトレードオフを補完的に調整。 ・衝突する目標とエージェント間の役割差を同時に最適化する理論的枠組みを提示。 ・ロボット制御や複数チーム運用など実務的応用の基礎となる可能性。
・医療用マルチモーダル大規模言語モデル(MLLM)の信頼性向上を目的とした研究。 ・既存ベンチマークとは異なり、幻覚がどの推論段階で発生するかを特定する手法を提案。 ・視覚認識エラー、医学知識の不正確な想起、推論統合の欠陥など、複数の幻覚源を識別可能。 ・医療診断支援システムの安全性向上に向けた基礎研究。
・ロボットが関節付きの道具(ドアハンドルやペンチなど)を器用に操作することは、複雑な接触と多自由度の調整が必要なため困難だった課題 ・既存研究は剛体物体に焦点を当てており、機能的な把握と操作政策の学習方法が未解決のまま ・Mana(Manipulation Animator)は、シミュレーション環境で学習した戦略を実機ロボットに転用する汎用フレームワークを提案
・ビジョン言語モデル(VLM)がロボットなどの具体化エージェントの高次プランナーとして使用される際、テスト時の計算量拡大が性能向上に必ずしも繋がらない課題を指摘。 ・計算量増加によって遅延・トークン使用量・FLOPsが増加する一方で、下流のタスク成功率向上は不均等で限定的であることを実証。 ・効率的な運用のため、計算リソースの配置タイミングと場所を選別する必要性を提案。
・低価格ロボットアームには高額な力覚センサが搭載されていないため、接触が必要な作業が困難であった ・Neural External Torque Estimation(NEXT)は10分間のフリーモーション データのみから1分で外力推定モデルを学習できる ・推定精度は専用力覚センサと同等であり、低価格アームでの力覚フィードバック遠隔操作を可能にする