[
控场AI
]
知识动态
实体
播客
深度
开发者
关于
Get CLI
EN
概念
LLM-as-a-Judge / LLM Judge
LLM裁判
由Zheng等人在2023年系统化提出的评估范式,利用能力更强的LLM对被测模型输出进行打分或排序,可评估语义相关性、逻辑连贯性等难以规则化的维度,成本低于大规模人工标注
来源文章
用Pydantic Evals量化LLM输出质量并纳入CI质量门禁
7月16日