Harvey Labs
harveyai/harvey-labs
访问 GitHub ↗
一句话简介
Harvey Labs 是由 Harvey AI 维护的实验性代码仓库,面向法律与生成式 AI 研究,提供模型工具与基础实现示例。
标签
适用应用场景
- 法律文本生成与摘要
- 检索增强生成实验
- 法律领域模型微调
- AI 辅助合同分析
README 中文摘要
Harvey LAB:法律智能体基准
Harvey LAB 是一个开源项目,用于在真实法律场景中评测大语言模型智能体完成法律工作的能力。项目包含两部分:任务数据集(含智能体指令、文档与评分细则)与执行框架(用于运行智能体并对其结果进行打分)。项目持续维护,任务集合与执行框架会不断扩充与改进。
项目概览
- 法律实践领域:覆盖 24 个以上的合同类业务方向
- 任务数量:1671 项
- 许可证:MIT
- 配套提供完整走读教程(教程位于
docs/tutorial.md),以一项并购数据室任务为例,端到端演示环境搭建、任务查看、智能体执行、打分、报告审阅与对比仪表板的全部流程。
核心架构
Harvey LAB 的架构由以下几个层次组成:
- 任务模型:以结构化方式定义指令、输入文档与评分细则
- 执行框架(Harness):负责加载任务、调用智能体并记录执行轨迹
- 工具与适配器:抽象出模型无关的调用接口,便于接入不同的大语言模型后端
- 报告与扫描(Sweeps):汇总多次运行结果,生成可对比的评测报告
评测方法
评测采用全通过(all-pass)评分机制:智能体的输出需满足评分细则中的全部要点方可得分。同时引入 LLM 作为评判器(LLM judge),对开放式法律任务的回答质量进行自动化评估,详见评测方法文档。
入门使用
建议首先阅读 docs/tutorial.md,按照教程中的步骤完成一个完整的任务周期。其余文档可按需查阅:
| 文档 | 内容说明 |
|---|---|
| Architecture | 任务模型、执行框架、工具、适配器、报告与扫描 |
| Evaluation Methodology | 全通过评分细则与 LLM 评判器行为 |
| Contributing | 如何新增任务、模型适配器、评测改进与文档 |
代码与数据引用
如果需要在研究中引用 Harvey LAB,可使用以下 BibTeX 条目:
# Harvey LAB 法律智能体基准引用条目
@misc{harveylab2026,
title = {Harvey LAB: The Legal Agent Benchmark},
author = {{Harvey AI}},
year = {2026},
version = {v1.0},
url = {https://github.com/harveyai/harvey-labs/tree/v1.0},
note = {Announcement: \url{https://www.harvey.ai/blog/introducing-harveys-legal-agent-benchmark}}
}
参与贡献
项目欢迎以任务新增、模型适配器扩展、评测方法改进、文档完善等形式参与贡献。具体流程参见贡献指南文档。
摘要更新于 2026-08-10 00:30:57
· 原文 2624 字符
· md5 9073d0625824…