Skip to main content
Deep research benchmark 评测 agent 是否能收集证据、处理长上下文,并输出最终答案或研究报告。许多任务依赖 judge model,建议尽量把被评测模型和 judge model 分开。

推荐组合

Judge-scored 最小示例

实用建议

相关页面