待验证50% 置信基准精确时间
LLM-as-a-Judge范式由斯坦福大学的MT-Bench与Chatbot Arena研究正式引入学术视野(Zheng et al., 2023),研究发现强大LLM在评估开放式问答质量方面与人类评分者一致性可达80%以上
1
来源数
50%
置信度
长期有效
时效性
2026/7/15
首次发现
来源
相关事实
待验证智谱GLM系列由清华技术团队打造,擅长中文理解和多轮对话59% 相似待验证2017年Finale Doshi-Velez与Been Kim在论文《Towards A Rigorous Science of Interpretable Machine Learning》中梳理了可解释性评估的三个层次:应用级评估、人类级评估和功能级评估56% 相似待验证兰德公司、生物安全中心等机构的评估显示,当前顶级模型已在某些生化知识问答上展现出超越普通大学生的能力56% 相似待验证智谱AI的GLM系列基于自研底座架构,技术根基来自清华大学KEG实验室56% 相似待验证真正的开放问题求解能力被许多研究者视为通用智能的重要标志之一55% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/514417API
curl https://kongchang.com/api/v1/knowledge/claims/514417MCP
get_claim(id=514417)