新着
今日 23件5月5日(火)
· 2件AI 推論、
OLTP++ 型の 負荷に 対応 AI エージェントの推論は OLTP++ 型の負荷を生みます。 数千のエージェントがミリ秒単位で並列にクエリを発行します。 EBS のバースト枠は数分で枯渇し、遅延が 50 ミリ秒に急増します。
The Register · AI + ML
5月4日(月)
· 1件4月24日(金)
· 1件Ethan Mollick、
GPT-5.5 の 実力を 検証 Ethan Mollick 氏が GPT-5.5 の早期アクセスを試しました。詳しくは出典へ。
One Useful Thing(Ethan Mollick)
4月2日(木)
· 1件Cohere、
企業 AI 成熟の 5 段階を 分析 Cohere が企業 AI 成熟の 5 段階を解説しました。 多くの企業はツール導入と内部基盤の間で停滞します。 本番移行はデータアクセスと LLM への不信が壁です。
Cohere Blog
4月1日(水)
· 1件3月30日(月)
· 1件Stockmark、
議事録から 要望抽出を 自動化 Stockmark が商談議事録からの要望抽出を自動化しました。 amptalk の議事録と API を活用し既存フローは変更しません。 入力作業は 1 件 5分以上から実質ゼロになりました。
Stockmark Tech Blog
3月26日(木)
· 1件Stockmark、
Skills ハッカソンを 開催 Stockmark が Skills をテーマに社内ハッカソンを開催しました。 吉田さんが Redash を Claude から操作する Skills で優勝しました。 Redash Skills は読み取り専用で書き込み系 SQL を弾きます。
Stockmark Tech Blog
3月23日(月)
· 1件ABEJA、
エッジ VLM の 構造化出力を 検証 ABEJA がエッジ環境の VLM による構造化出力を検証しました。 Grammar 制約で JSON 形式を強制し、出力崩れを防ぎます。 Visual Prompt Injection への出力層の防御にもなります。
ABEJA Tech Blog
3月16日(月)
· 1件Stockmark、
Devin で 社内 QA を 半自動化 Stockmark が Devin で社内 QA を半自動化しました。 月平均 55 件の問い合わせを 49% 減の 27 件に削減しました。 信頼度が高い回答の正答率は 95% です。
Stockmark Tech Blog
3月12日(木)
· 1件3月11日(水)
· 1件3月10日(火)
· 1件ABEJA、
Agentic RL の 知見を 公開 ABEJA が Agentic RL の取り組みと知見を公開しました。 SFT と強化学習でエージェント能力を強化しています。 検索ツールに OpenSearch を採用しています。
ABEJA Tech Blog
3月3日(火)
· 1件Mentor Pi、
ROS 2 で 動かす環境構築 Mentor Pi を ROS 2 で動かす環境を構築しました。 macOS では Gazebo と pixi を使いシミュレーションします。 SLAM の自動探索を frontier exploration で検証しました。
ABEJA Tech Blog
2月20日(金)
· 1件筆者、
VSCode から Zed に 移行し満足 筆者が VSCode から Zed に移行しました。 Neovim は操作の習得が難しく挫折しました。 Zed は軽快で設定も 1時間未満で完了しました。
Stockmark Tech Blog
2月18日(水)
· 1件2月13日(金)
· 1件SSH の
1 文字送信、 100 パケットの 謎を Claude Code で 調査 SSH の 1 文字入力で 270 パケットが送信されます。 36 バイトのパケットが全体の 66.3% を占めます。
ABEJA Tech Blog
1月28日(水)
· 1件ペンシルベニア大、
AI 起業講座を 実施 ペンシルベニア大学で 4日間の起業講座が実施されました。 学生は Claude Code と Google Antigravity で試作品を作りました。 AI 利用で従来の半年分を上回る進捗が得られました。
One Useful Thing(Ethan Mollick)
1月22日(木)
· 1件Mistral AI、
vLLM の メモリリークを 調査 Mistral AI が vLLM のメモリリークを調査しました。 リークは P/D 分離構成の decode 側でのみ発生しました。 システムメモリが毎分 400 MB 増加しました。
Mistral AI
1月8日(木)
· 1件Ethan Mollick、
Claude Code を 検証 Ethan Mollick 氏が Claude Code を試しました。詳しくは出典へ。
One Useful Thing(Ethan Mollick)
2025年12月25日(木)
· 2件ABEJA、
NVIDIA Clara で 医療 AI を 試用 ABEJA の坂井氏が NVIDIA Clara で医療 AI を試しました。 VISTA-3D を CT 画像でファインチューニングしました。 BioNeMo でタンパク質言語モデル ESM-2 の学習と推論を行いました。
ABEJA Tech Blog
2025年12月24日(水)
· 3件ABEJA、
gpt-oss-120b の 推論を 検証 ABEJA が gpt-oss-120b の推論能力を検証しました。 論理クイズや数学の問題を解かせて思考過程を観察しました。 設定は temperature 1.0、reasoning effort は high です。
ABEJA Tech BlogABEJA、
Strands と AgentCore で 分析基盤 ABEJA が Strands と AgentCore で分析基盤を構築しました。 自然言語の質問を SQL に変換し Athena で実行します。 本番 DB には接続せず S3 上のデータを参照します。
ABEJA Tech Blogπ0 の
action expert、 実装を 理解 ABEJA の大谷氏が π0 の action expert をコードで解説しました。 action expert は VLM に後付けし連続アクションを生成します。 Flow Matching の基礎を三日月データで確認します。
ABEJA Tech Blog
2025年12月21日(日)
· 1件AI の
形、 ギザギザと ボトルネックと 突出 Ethan Mollick 氏が AI 能力のギザギザを解説しました。 記憶や視覚など伸びない弱点がボトルネックになります。
One Useful Thing(Ethan Mollick)
2025年11月19日(水)
· 1件Ethan Mollick、
Gemini 3 を 検証 Ethan Mollick 氏が Gemini 3 と Antigravity を試しました。詳しくは出典へ。
One Useful Thing(Ethan Mollick)
2025年11月12日(水)
· 1件AI の
面接評価、 ベンチマークの 限界 Ethan Mollick が AI を面接で評価する方法を解説しました。 ベンチマークは公開や未校正などの問題を抱えます。 vibes による評価は個人向けで、標準化には不十分です。
One Useful Thing(Ethan Mollick)
2025年10月20日(月)
· 1件Ethan Mollick、
AI 活用ガイドを 公開 Ethan Mollick が AI 活用の実践ガイドを公開しました。 主要モデルは Claude、Gemini、ChatGPT、Grok の 4 系統です。 有料プランは月 20 ドルと約 200 ドルの 2 段階です。
One Useful Thing(Ethan Mollick)
2025年9月30日(火)
· 1件Ethan Mollick、
AI エージェントの 実務利用を 分析 Ethan Mollick 氏が AI エージェントの実務利用を分析しました。詳しくは出典へ。
One Useful Thing(Ethan Mollick)
2025年9月12日(金)
· 1件Ethan Mollick、
魔法使い型の 協働を 提唱 Ethan Mollick 氏は AI との関係が魔法使い型に移ったと論じました。詳しくは出典へ。
One Useful Thing(Ethan Mollick)
2025年8月12日(火)
· 1件METR、
科学コミュニケーションの 課題 METR が科学コミュニケーションの考え方を解説しました。 開発者生産性の研究では AI 利用時に開発者が遅くなりました。 見出しでは「AI が遅くする」と「期待のずれ」を重視しました。
METR
2025年8月1日(金)
· 1件Mistral、
Pixtral-12B を 衛星画像で 調整 Mistral が Pixtral-12B を衛星画像で調整しました。 LoRA でモデル全体を再学習せず効率的に適応できます。 AID の分類で基本モデルを上回る精度を達成しました。
Mistral AI
2025年6月27日(金)
· 1件METR、
AI リスク開示の 論点を 提示 METR がフロンティア AI のリスク開示の論点を示しました。 公開情報だけでは危険な能力を把握できないと指摘します。 3 か月ごとの外部チームによるリスク調査案を提示します。
METR
2025年6月18日(水)
· 1件Stockmark、
OpenSearch 2.17 へ 無停止移行 Stockmark が OpenSearch を 2.17 へ無停止で移行しました。 Elasticsearch 7.10 から 1.3 を経て 2 段階で移行しました。 ANN を使ったベクトル検索の導入が目的です。
Stockmark Tech Blog
2025年6月12日(木)
· 1件Claude Code、
開発者の 業務を 7 割代替 Claude Code が開発者の業務の約 7 割を代替できます。 Sonnet4 と Opus4 をほぼ使い放題で利用できます。 大規模な 0→1 開発や UI 実装は苦手です。
Stockmark Tech Blog
2025年6月10日(火)
· 1件2025年6月9日(月)
· 1件Devin、
Flutter アプリの 依存更新を 支援 Devin が Flutter アプリの依存関係更新を支援しました。 古いライブラリの更新計画を issue にまとめます。 dependabot の PR を週次で確認し要約します。
Stockmark Tech Blog
2025年5月13日(火)
· 1件4 社共催、
マルチモーダル LT を 開催 ストックマークなど 4 社が LT イベントを開催しました。 Algomatic は画像を 3D 風へ変換する手法を紹介しました。 サイバーエージェントは漫画を自動ローカライズします。
Stockmark Tech Blog
2025年4月9日(水)
· 1件Mistral、
RAG 評価の 3 指標を 提供 Mistral が RAG 評価の手法を解説しました。 RAG Triad は文脈関連性・根拠性・回答関連性で評価します。 構造化出力で判定用 LLM の評価を安定させます。
Mistral AI