MemDreamer:長時間動画理解のための知覚と推論の分離と階層グラフメモリ
・視覚言語モデルが長時間動画の処理でトークン数爆増と注意散漫に直面する問題に対し、MemDreamerが知覚と推論を分離する手法を提案。 ・動画をインクリメンタルにストリーミング処理し、セマンティック抽象化を行う3層階層グラフメモリを構築することで効率化を実現。 ・エージェント的検索メカニズムにより、長時間動画の理解を段階的な探索プロセスに再構成。 ・プラグアンドプレイフレームワークとして既存モデルに統合可能な設計。

