Stockmark、 LLM 評価の 多様性を 分析
Stockmark が LLM-as-a-Judge の評価多様性を分析しました。 専門家同士でも細かいスコアは一致しにくいです。 評価者ごとに合わせた判定は一致度が高まります。
Stockmark が LLM-as-a-Judge の評価多様性を分析しました。 専門家同士でも細かいスコアは一致しにくいです。 評価者ごとに合わせた判定は一致度が高まります。
適応的並列推論が効率的な新手法として注目されています。 逐次推論はコンテキスト上限と遅延の増大を招きます。 既存手法は並列構造を固定しており、適応制御が課題です。
METR が Anthropic の R&D 自動化リスク評価を批判しました。 調査結果の分析と提示方法に重大な問題があると指摘します。 Opus 4.6 のリスクが非常に低いという結論自体には同意します。
Cohere が企業 AI 成熟の 5 段階を解説しました。 多くの企業はツール導入と内部基盤の間で停滞します。 本番移行はデータアクセスと LLM への不信が壁です。
Kotoba Technologies の創業者 2 人が Pivot に出演しました。 第 1 部では AI 研究の道のりと人類の未来を語ります。 第 2 部では 2026年に言語の壁が消えるとの見方を示します。
SSH の 1 文字入力で 270 パケットが送信されます。 36 バイトのパケットが全体の 66.3% を占めます。
METR が科学コミュニケーションの考え方を解説しました。 開発者生産性の研究では AI 利用時に開発者が遅くなりました。 見出しでは「AI が遅くする」と「期待のずれ」を重視しました。
METR がフロンティア AI のリスク開示の論点を示しました。 公開情報だけでは危険な能力を把握できないと指摘します。 3 か月ごとの外部チームによるリスク調査案を提示します。
Claude Code が開発者の業務の約 7 割を代替できます。 Sonnet4 と Opus4 をほぼ使い放題で利用できます。 大規模な 0→1 開発や UI 実装は苦手です。
METR が AI 推論の可読性と忠実性の価値を解説しました。 可読で忠実な推論は AI のミスや欺瞞の検出を容易にします。 OpenAI や Anthropic など 5 社が推論モデルを公開しました。
METR が配備前テスト偏重の AI 安全政策は不十分だと指摘しました。 モデル窃取や内部利用による壊滅的悪用は防げません。 危険能力の早期評価と重みの保護、透明性の強化を求めています。