ViDscribe: Multimodal AI for Customizing Audio Description and Question Answering in Online Videos

盲人・低視力者向けに、マルチモーダルAIを使用して動画の音声説明を自動生成・カスタマイズする技術を提案した論文。

視覚障害, 動画, 生成AI