FGRPO: Fine-grained reasoning preference optimization with iterative stabilization for mathematical reasoning in large language model
['Baozhen Lee', 'Yongxv Lv', 'Tingting Zhang']
/
Information Sciences
/ Vol. 741
まだレビューは投稿されていません。あなたが最初のレビューを書きませんか?