标签: Benchmark
包含该标签的所有文章 "Benchmark".
-
RAG 系列(九):从代码到完整评测实验
前五篇建立了指标和设计。本篇把它们映射到真实代码、命令和产物,并用`stage2-20260824-final`解释一次完整实验应该怎样复现、审计和转化为优化任务。
-
RAG 系列(三):Embedding 检索评测与 Benchmark
本篇回答一个工程问题:两个Embedding模型都能运行,怎样判断谁更适合当前真实知识库?重点评测Retriever,不把LLM的语言风格和随机性混进实验。