2025-02-07から1日間の記事一覧
LLMにGroup Relative Policy Optimization (GRPO)をLoRAと組み合わせて、GPUリソースが少なくても学習させることができる手法をUnslothさんが提案されていたので、ためしてみます。サンプルのColabモデルでベースモデルをSakanaAI/TinySwallow-1.5B-Instruct…
LLMにGroup Relative Policy Optimization (GRPO)をLoRAと組み合わせて、GPUリソースが少なくても学習させることができる手法をUnslothさんが提案されていたので、ためしてみます。サンプルのColabモデルでベースモデルをSakanaAI/TinySwallow-1.5B-Instruct…