AI の 面接評価、 ベンチマークの 限界
Ethan Mollick が AI を面接で評価する方法を解説しました。 ベンチマークは公開や未校正などの問題を抱えます。 vibes による評価は個人向けで、標準化には不十分です。
One Useful Thing(Ethan Mollick)
Ethan Mollick が AI を面接で評価する方法を解説しました。 ベンチマークは公開や未校正などの問題を抱えます。 vibes による評価は個人向けで、標準化には不十分です。
METR が Anthropic の sabotage リスク報告をレビューしました。 Claude Opus 4 と 4.1 の壊滅的 sabotage リスクは低いと結論しました。 Opus 4 が本能的な misaligned 推論をする可能性を指摘しました。
Ethan Mollick が AI 活用の実践ガイドを公開しました。 主要モデルは Claude、Gemini、ChatGPT、Grok の 4 系統です。 有料プランは月 20 ドルと約 200 ドルの 2 段階です。
Ethan Mollick 氏が AI エージェントの実務利用を分析しました。詳しくは出典へ。
Ethan Mollick 氏は AI との関係が魔法使い型に移ったと論じました。詳しくは出典へ。
Claude Code が開発者の業務の約 7 割を代替できます。 Sonnet4 と Opus4 をほぼ使い放題で利用できます。 大規模な 0→1 開発や UI 実装は苦手です。
METR が AI 推論の可読性と忠実性の価値を解説しました。 可読で忠実な推論は AI のミスや欺瞞の検出を容易にします。 OpenAI や Anthropic など 5 社が推論モデルを公開しました。