共 2 篇相关文章
提示词措辞的细微变化会影响大语言模型的引用行为吗?本文从指标定义、A/B测试设计、引用幻觉识别到统计显著性验证,系统讲解如何科学测试LLM引用行为,帮助AI应用开发者构建更可靠的提示工程实践。
AI写作中的「引用幻觉」正威胁学术诚信——大模型会生成格式完整却根本不存在的虚假文献。本文介绍一款开源MCP服务器,可在AI生成引用的同时实时比对CrossRef、PubMed等权威数据库,将引用核查前置到写作阶段,帮助研究者从源头拦截虚假引用。