#マルチモーダル
今日 7件6月24日(水)
· 1件6月17日(水)
· 1件Ai2、
3D 動作予測モデル MolmoMotion を 公開 Ai2 が 3D 動作予測モデル MolmoMotion を公開しました。詳しくは出典へ。
Allen Institute for AI (Ai2)
6月16日(火)
· 1件LINE ヤフー、
Google I/O 2026 に 初参加 LINE ヤフー社員が Google I/O 2026 に初参加しました。 Intelligent Eyewear は Gemini と連携するオーディオグラスです。 Gemma 4 はライセンスが Apache 2.0 に変更されました。
LINEヤフー Tech Blog
6月9日(火)
· 1件6月5日(金)
· 1件5月29日(金)
· 1件5月28日(木)
· 1件5月21日(木)
· 1件Ai2 の
モデルで 作る 検査ツールを 提供 Brendan Works 氏がアクセシビリティ検査ツールを作成しました。 Molmo などを組み合わせ、画面表示を基に検査します。 Playwright でキーボード操作を再現し確認します。
Allen Institute for AI (Ai2)
5月20日(水)
· 1件5月18日(月)
· 2件DeepMind、
Project Genie に Street View 連携 DeepMind が Project Genie に Street View 連携を追加しました。詳しくは出典へ。
Google DeepMind
5月17日(日)
· 1件5月16日(土)
· 2件5月5日(火)
· 1件Gemini、
File Search を マルチモーダル対応に Gemini の File Search がマルチモーダル検索に対応しました。 gemini-embedding-2 で画像の埋め込みと検索が可能です。
Gemini API Changelog
4月30日(木)
· 2件OpenAI、
画像モデル Images 2.0 を 公開 OpenAI が画像モデル ChatGPT Images 2.0 を公開しました。 Moonshot AI が 1T パラメータの Kimi K2.6 を公開しました。 MiniMax がエージェントモデル M2.7 をオープンソース化しました。
Last Week in AI
4月28日(火)
· 1件4月16日(木)
· 1件Anthropic、
Claude Opus 4.7 を 公開 Anthropic が Claude Opus 4.7 を公開しました。詳しくは出典へ。
Claude Platform Release Notes
4月14日(火)
· 1件DeepMind、
Gemini Robotics-ER 1.6 を 公開 DeepMind が Gemini Robotics-ER 1.6 を公開しました。詳しくは出典へ。
Google DeepMind
4月9日(木)
· 1件3月25日(水)
· 2件3月23日(月)
· 1件ABEJA、
エッジ VLM の 構造化出力を 検証 ABEJA がエッジ環境の VLM による構造化出力を検証しました。 Grammar 制約で JSON 形式を強制し、出力崩れを防ぎます。 Visual Prompt Injection への出力層の防御にもなります。
ABEJA Tech Blog
3月18日(水)
· 1件3月17日(火)
· 1件3月10日(火)
· 1件2月13日(金)
· 1件1月31日(土)
· 1件1月8日(木)
· 1件Gemini API、
データ入力に 対応 Gemini API がデータ入力に対応しました。 Cloud Storage バケットと署名付き URL を入力元に使えます。 ファイルサイズの上限は 20MB から 100MB に拡大しました。
Gemini API Changelog
2025年12月21日(日)
· 1件AI の
形、 ギザギザと ボトルネックと 突出 Ethan Mollick 氏が AI 能力のギザギザを解説しました。 記憶や視覚など伸びない弱点がボトルネックになります。
One Useful Thing(Ethan Mollick)
2025年12月18日(木)
· 1件2025年12月17日(水)
· 1件Google、
Gemini 3 Flash Preview を 公開 Google が Gemini 3 Flash Preview を公開しました。詳しくは出典へ。
Gemini API Changelog
2025年12月3日(水)
· 1件2025年7月17日(木)
· 1件2025年6月3日(火)
· 1件2025年5月13日(火)
· 1件4 社共催、
マルチモーダル LT を 開催 ストックマークなど 4 社が LT イベントを開催しました。 Algomatic は画像を 3D 風へ変換する手法を紹介しました。 サイバーエージェントは漫画を自動ローカライズします。
Stockmark Tech Blog