Harvey Labs

harveyai/harvey-labs 访问 GitHub ↗
🔤 Python ★ 1077 ⑂ 0 daily #13 (+28) 抓取 2026-08-12

一句话简介

Harvey Labs 是由 Harvey AI 维护的实验性代码仓库,面向法律与生成式 AI 研究,提供模型工具与基础实现示例。

标签

  • Python
  • 法律AI
  • 生成式AI
  • 实验项目
  • 开源工具

适用应用场景

  • 法律文本生成与摘要
  • 检索增强生成实验
  • 法律领域模型微调
  • AI 辅助合同分析

README 中文摘要

Harvey LAB:法律智能体基准

Harvey LAB 是一个开源项目,用于在真实法律场景中评测大语言模型智能体完成法律工作的能力。项目包含两部分:任务数据集(含智能体指令、文档与评分细则)与执行框架(用于运行智能体并对其结果进行打分)。项目持续维护,任务集合与执行框架会不断扩充与改进。

项目概览

  • 法律实践领域:覆盖 24 个以上的合同类业务方向
  • 任务数量:1671 项
  • 许可证:MIT
  • 配套提供完整走读教程(教程位于 docs/tutorial.md),以一项并购数据室任务为例,端到端演示环境搭建、任务查看、智能体执行、打分、报告审阅与对比仪表板的全部流程。

核心架构

Harvey LAB 的架构由以下几个层次组成:

  • 任务模型:以结构化方式定义指令、输入文档与评分细则
  • 执行框架(Harness):负责加载任务、调用智能体并记录执行轨迹
  • 工具与适配器:抽象出模型无关的调用接口,便于接入不同的大语言模型后端
  • 报告与扫描(Sweeps):汇总多次运行结果,生成可对比的评测报告

评测方法

评测采用全通过(all-pass)评分机制:智能体的输出需满足评分细则中的全部要点方可得分。同时引入 LLM 作为评判器(LLM judge),对开放式法律任务的回答质量进行自动化评估,详见评测方法文档。

入门使用

建议首先阅读 docs/tutorial.md,按照教程中的步骤完成一个完整的任务周期。其余文档可按需查阅:

文档 内容说明
Architecture 任务模型、执行框架、工具、适配器、报告与扫描
Evaluation Methodology 全通过评分细则与 LLM 评判器行为
Contributing 如何新增任务、模型适配器、评测改进与文档

代码与数据引用

如果需要在研究中引用 Harvey LAB,可使用以下 BibTeX 条目:

# Harvey LAB 法律智能体基准引用条目
@misc{harveylab2026,
  title   = {Harvey LAB: The Legal Agent Benchmark},
  author  = {{Harvey AI}},
  year    = {2026},
  version = {v1.0},
  url     = {https://github.com/harveyai/harvey-labs/tree/v1.0},
  note    = {Announcement: \url{https://www.harvey.ai/blog/introducing-harveys-legal-agent-benchmark}}
}

参与贡献

项目欢迎以任务新增、模型适配器扩展、评测方法改进、文档完善等形式参与贡献。具体流程参见贡献指南文档。

摘要更新于 2026-08-10 00:30:57 · 原文 2624 字符 · md5 9073d0625824…