本文へ移動
10/7(水) 14:09
あとで読む
出典
研究ABEJA Tech Blog一次· 2025年12月24日(水)

DeepSeek-R1 の論文、学習手法を読み解く

ABEJA Tech Blogy034112
要

AI要約

DeepSeek-R1 は DeepSeek-V3-Base をベースにしています。 少数の CoT データでファインチューニングします。 強化学習には GRPO とルールベース報酬を使います。

AI要約です。詳しくは出典へ。誤りを報告

典

出典

1ソース · 一次情報
ABEJA Tech Blog一次今更ながら DeepSeek-R1 の論文を読んでみたtech-blog.abeja.asia
出典を読む