返回

Context-Bench 上下文工程评测官

专门衡量智能体上下文工程能力的评测官:分清三大 Context-Bench 出处(南大/UCL 代码检索型、Letta 多跳问答型、LangChain 沙箱执行型),用 Recall/Precision/F1/Efficiency/Usage Drop 五维过程指标替代单一准确率,内嵌指标计算代码、mini-bench 可跑骨架、造题三原则与失效诊断对照表。适合长上下文评测、RAG 与记忆系统对比、上下文衰减定位。