
【AI論文解説】CLEAR: Character Unlearning in Textual and Visual Modalities:マルチモーダルAIにおける『忘れる技術』を評価する新たなベンチマークデータセット
近年、ディープラーニングモデルの大規模化に伴い、プライバシーやセキュリティに関する懸念が高まっています。特に、テキストと画像の両方を扱う大規模マルチモーダル言語...
生成AI、画像認識、AI開発企業等のAI会社マッチング支援サービス

近年、ディープラーニングモデルの大規模化に伴い、プライバシーやセキュリティに関する懸念が高まっています。特に、テキストと画像の両方を扱う大規模マルチモーダル言語...

本論文は、画像とテキストのマルチモーダル表現学習を向上させる新しいアプローチ「LLM2CLIP」を提案しています。 従来のCLIPモデルは、画像とテキストを共有...

従来のロボットが数値を処理する「反応」主体だったのに対し、世界モデルは「なぜそうなるか」という物理的意味を理解 高精度な内部モデル(仮想空間)での試行錯誤が可能...

Gemini 3は、推論力・マルチモーダル性能を刷新し、2.5 Proを大幅に上回る次世代フラッグシップモデルとして登場 生成インターフェースや新デザインにより...

Qwen3-VLはAlibabaのQwenチームが開発したマルチモーダル基盤モデルでテキスト・画像・動画の理解と生成を統合 Gemini 2.5 ProやGPT...

Veo 3はテキストや画像から映像と音声を同時生成するGoogleの動画生成AIモデル リアリズムや忠実度が向上し、映画風短編や広告など多様な映像制作に対応 G...

高速応答用モデルと深い推論用モデルを統合し、質問内容に応じて自動切替する構造を持つ ハルシネーション率や誤答率を大幅に低減し、安全かつ正確な回答を生成する コー...

OpenAI Responses APIは、従来のAPIの機能を統合・強化したAIエージェント構築の次世代基盤 マルチターン対話、マルチモーダル対応、Web検索...

ChatGPTはテキストだけでなく、画像、音声、ファイルなどを統合的に扱う「マルチモーダル機能」を備えており多様な業務を効率化 画像生成、画像認識、音声・動画解...

OpenAIのo4は、高度な推論と効率性を両立。ChatGPTやAPIで利用可能。 数学、コーディング、画像理解などで高性能を発揮し、o3から進化。低コストで利...