本文へ移動
10/7(水) 14:09
あとで読む
出典
視点ABEJA Tech Blog一次· 6/8(月)

ABEJA、LLM 強化学習の Rollout ズレを解説

ABEJA Tech Bloggo5paopao
要

AI要約

ABEJA が LLM 強化学習の Rollout ズレを解説しました。 vLLM と transformers では同じ Token でも確率が最大 0.215 ずれます。 ズレの補正には Importance Sampling が使われます。

AI要約です。詳しくは出典へ。誤りを報告

典

出典

1ソース · 一次情報
ABEJA Tech Blog一次On-policy のはずが Off-policy になる:LLM 強化学習 の rollout mismatchと対策(rollout correction)tech-blog.abeja.asia
出典を読む