マルチモーダル
テキスト以外の能力です。画像理解、画像とテキストの混在、音声と動画の入出力を持つモデルとプロダクトを追います。
新しい順
21–40本目 · 全 69本9月10日(木)
· 2件9月3日(木)
· 1件9月1日(火)
· 1件Google、
Gemini 3.7 Flash に 動画理解を 追加 Google が Gemini 3.7 Flash などに動画理解を追加しました。詳しくは出典へ。
Gemini API Changelog
8月28日(金)
· 1件8月27日(木)
· 1件8月21日(金)
· 1件DeepSeek、
V4-Flash-Vision-Exp を 公開 DeepSeek が視覚理解モデル V4-Flash-Vision-Exp を公開しました。詳しくは出典へ。
DeepSeek API Change Log
8月18日(火)
· 1件Hugging Face、
遅延相互作用モデルに 対応 Sentence Transformers v6.0 が MultiVectorEncoder を追加しました。詳しくは出典へ。
Hugging Face Blog