专注于Prompt测试、实验和迭代的AI评估工具,适合快速试错的产品开发团队,但多轮对话测试和红队测试能力较为轻量
业界常用的AI产品评测工具包括LangSmith、Braintrust、Promptfoo等
LangSmith 和 Braintrust 等平台允许开发者追踪每一轮代理决策的推理过程、Token 消耗和行为轨迹
Braintrust和RAGAS是AI评估(Evaluation)方向的代表工具
LangSmith、Braintrust、Patronus AI等公司正从不同角度切入AI测试与评估赛道
LangSmith、Braintrust、Ragas等多个AI评估平台都已将LLM-as-Judge作为核心功能集成
AI Agent测试与可观测性赛道的相关公司包括Langfuse、Braintrust和Patronus AI