# 500 美元的 RL 微調使 9B 開源模型在目錄評價中超越最先進模型

**微調** 和 **最先進模型** 的比較研究顯示，僅需 500 美元的 **強化學習** 微調就能使 9B 開源模型在目錄評價任務中超越最先進模型。這項研究引發了對 **模型微調** 和 **最先進模型** 的選擇的討論，以及 **模型能力** 和 **成本** 之間的關係。

原始來源（Hacker News）：https://fermisense.com/when-machines-take-the-wheel/

— ai.luvai.net（繁中 AI 情報站）
