Tag Archive

标签:LLM-judge

这里整理所有带有「LLM-judge」标签的文章,方便按主题快速回看。

LLM-judge

共 1 篇
论文精读 · 2026-09-29

Unslopping AI(RL-XAR)详解:怎么让 AI 不再写“AI 味”的文字

Meta FAIR(Jason Weston 组)2026 年 9 月博客:先证明 LLM judge 分不清专家人类写作和 AI slop,再用“元优化评分规则”造出能识别专家质量的奖励,然后 RL——一套把“不可验证任务”变成“可验证任务”的完整配方。
RLHF奖励模型写作质量LLM-judgeMeta-FAIR后训练