Google 开源的 LangExtract,就是专门干这个的。
给它几个示例,它就能用 LLM 从非结构化文本里提取指定信息,而且每条结果都能对应回原文位置,方便检查来源。
几个实用点:
① 自动分块,支持长文档并行处理
② 支持 Gemini、OpenAI,也能接本地 Ollama
③ 自带 HTML 可视化,提取结果直接在原文里高亮
④ 不需要专门微调模型,给示例就能开始用
合同、报告、论文、小说这类长文本,都可以拿来试试。
🔗 https://github.com/google/langextract