Token导航 LogoToken导航TokenDH.com
效率敏感数据clawhub未标认证来源可访问clear审计提醒

langextractlangextract 搜索

Agent Skill

langextract 用于辅助 Python 项目开发、测试和数据处理,适合在 OpenClaw 中需要阅读 Python 代码、运行测试或整理脚本流程时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

2,399

周安装

98

GitHub Stars

公开资料未说明

下载量

776
OpenClaw

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

MIT-0

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:langextract(langextract 搜索)
来源仓库:https://github.com/cn-big-cabbage/langextract
安装命令:
openclaw skills install langextract
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 OpenClaw 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

ClawHubOpenClaw
openclaw skills install langextract

简介

Google 出品的 Python 库,用 LLM 从非结构化文本中提取结构化信息,每个提取结果精确对应源文本位置,支持交互式可视化,适配 Gemini/OpenAI/Ollama 等多种模型

SKILL.md

name
langextract
description
Google 出品的 Python 库,用 LLM 从非结构化文本中提取结构化信息,每个提取结果精确对应源文本位置,支持交互式可视化,适配 Gemini/OpenAI/Ollama 等多种模型
version
0.1.0
metadata
openclaw_requires
>=1.0.0
emoji
🔍
homepage
https://github.com/google/langextract

LangExtract — LLM 驱动的结构化信息提取

LangExtract 是 Google 出品的 Python 库,利用 LLM 从临床笔记、法律文书、新闻报道等非结构化文本中提取结构化信息。其核心优势是精确源文本定位:每个提取结果都映射到源文本的精确字符位置,支持可视化高亮审查,适合需要可追溯性的企业级数据提取场景。只需几个示例即可定义提取任务,无需微调模型。

核心使用场景

  • 医疗文本提取:从临床笔记提取药物、剂量、诊断结果,含可追溯的源文本定位
  • 法律文书解析:提取合同条款、当事方信息、关键日期等结构化字段
  • 文学/学术分析:提取人物、情感、关系等实体(如 Romeo and Juliet 示例)
  • 长文档批量处理:分块并行处理大型文档,支持多次 Pass 提高召回率
  • 交互式审查:生成自包含 HTML 可视化文件,高亮显示提取结果与源文本的对应关系

AI 辅助使用流程

  1. 安装依赖 — AI 执行 pip install langextract 并配置 API 密钥
  2. 定义提取任务 — AI 根据需求编写提取描述(prompt)和高质量示例(examples)
  3. 运行提取 — AI 调用 lx.extract() 处理文本或文档 URL
  4. 保存结果 — AI 将结果存为 JSONL 格式,便于后续分析
  5. 生成可视化 — AI 调用 lx.visualize() 生成交互式 HTML 审查界面
  6. 过滤非定位提取 — AI 过滤掉 char_interval=None 的结果,保留有源文本依据的提取

关键章节导航

  • 安装指南 — pip 安装、API 密钥配置、Ollama 本地模型
  • 快速开始 — 定义提取任务、运行提取、结果过滤、可视化
  • 高级用法 — 长文档处理、自定义模型、医疗/法律场景
  • 故障排查 — API 认证、Prompt 对齐警告、召回率低

AI 助手能力

使用本技能时,AI 可以:

  • ✅ 安装 LangExtract 并配置 Gemini/OpenAI API 密钥
  • ✅ 根据用户描述的提取需求,自动编写 prompt_descriptionexamples
  • ✅ 调用 lx.extract() 处理文本字符串或文档 URL
  • ✅ 过滤非定位(char_interval=None)的提取结果
  • ✅ 保存提取结果为 JSONL 格式
  • ✅ 生成交互式 HTML 可视化文件
  • ✅ 配置 Ollama 本地模型,避免 API 费用
  • ✅ 使用并行处理和分块策略处理长文档

核心功能

  • 精确源文本定位 — 每个提取结果映射到源文本的 char_interval(字符偏移)
  • 结构化输出 — 基于 Few-shot 示例强制输出一致 Schema
  • 长文档优化 — 文本分块 + 并行处理 + 多次 Pass,提高大文档召回率
  • 交互式可视化 — 自包含 HTML 文件,高亮显示数千个提取结果
  • 多模型支持 — Gemini(推荐)、OpenAI、Ollama 本地模型
  • 域无关 — 用 Few-shot 示例适配任意领域,无需微调
  • 自动对齐检测 — 检测示例与文本不匹配的情况并发出警告
  • URL 直接处理 — 可直接传入文档 URL(如 Gutenberg 文本)

快速示例

import langextract as lx

# 定义提取任务
result = lx.extract(
    text_or_documents="John took aspirin 500mg twice daily for headache.",
    prompt_description="Extract medications and dosages.",
    examples=[
        lx.data.ExampleData(
            text="Patient was prescribed ibuprofen 400mg.",
            extractions=[
                lx.data.Extraction(
                    extraction_class="medication",
                    extraction_text="ibuprofen 400mg",
                    attributes={"dosage": "400mg"}
                )
            ]
        )
    ],
    model_id="gemini-2.5-flash",
)

# 只保留有源文本依据的结果
grounded = [e for e in result.extractions if e.char_interval]
print(grounded)

# 生成可视化
lx.io.save_annotated_documents([result], output_name="out.jsonl", output_dir=".")
html = lx.visualize("out.jsonl")

安装要求

依赖版本要求
Python>= 3.9
Gemini API Key推荐(或 OpenAI/Ollama)
pip任意版本

项目链接

  • GitHub:https://github.com/google/langextract
  • PyPI:https://pypi.org/project/langextract/
  • 论文 DOI:https://doi.org/10.5281/zenodo.17015089

适合场景

01

OpenClaw 用户查找和安装 Skill 时

02

用户想查找某类 Agent Skill 时

03

需要根据任务场景推荐可安装能力包时

04

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenClaw

76.82%
按下载量换算596

安全审计

VirusTotal

通过

ClawScan

可疑

Static analysis

通过

权限和风险

敏感数据

该 Skill 可能接触密钥、Token、环境变量或敏感配置,应进入高风险复核队列,默认不自动发布。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills