AI办公自动化：kimi批量搜索提取PDF文档中特定文本内容

工作任务：PDF文档中有资料来源这一行，比如：

资料来源：moomoo tech、The Information、Bloomberg、Reuters，浙商证券研究所

数据来源：CSDN、浙商证券研究所

数据来源：CSDN、arXiv、浙商证券研究所

数据来源：秘塔AI搜索官网，Similarweb，Epic Connector，东吴证券研究所

来源：Github，《面向深度学习的多模态融合技术研究综述》，《Make-a-video: text-to-video generation without text-video data》，浙商证券研究所

来源：Github，OSCHINA，浙商证券研究所

希望提取文件中几百个PDF文档中的资料来源

在kimi中输入提示词：

你是一个Python编程专家，完成一个脚本编写任务，具体步骤如下：

打开文件夹：F:\研报下载\AIGC研报；

用pdfplumber 库读取文件夹中所有的PDF文件；

遍历PDF文档中的每行文本，查找以“资料来源：”开头、以“数据来源：”开头和以“来源：”开头的这一行文本内容；

保存这些文本内容到文件夹“F:\AI自媒体内容\AI行业数据分析”下的Excel文件中；

注意：

每一步都要输出信息

处理异常和错误：确保你的代码能够处理可能遇到的异常，如文件损坏、权限问题或格式不一致等。

Kimi生成的源代码：

import os

import re

import pdfplumber

from openpyxl import Workbook

# 定义要搜索的关键词

keywords = ["资料来源：", "数据来源：", "来源："]

# 定义源文件夹和目标文件夹路径

source_folder = r'F:\研报下载\AIGC研报'

target_folder = r'F:\AI自媒体内容\AI行业数据分析'

# 确保目标文件夹存在

os.makedirs(target_folder, exist_ok=True)

# 创建Excel工作簿

workbook = Workbook()

sheet = workbook.active

# 遍历源文件夹中的所有文件

for filename in os.listdir(source_folder):

if filename.endswith('.pdf'):

print(f"正在处理文件：{filename}")

# 构建完整的文件路径

file_path = os.path.join(source_folder, filename)

try:

# 使用pdfplumber打开PDF文件

with pdfplumber.open(file_path) as pdf:

# 遍历PDF文档中的每页

for page in pdf.pages:

text = page.extract_text()

# 使用正则表达式搜索关键词

for keyword in keywords:

pattern = re.compile(re.escape(keyword) + ".*")

matches = pattern.findall(text)

for match in matches:

print(f"找到匹配的文本：{match}")

# 将找到的文本写入Excel

sheet.append([match])

except Exception as e:

print(f"处理文件{filename}时发生错误：{e}")

# 保存Excel文件

excel_file_path = os.path.join(target_folder, 'AI_Industry_Analysis.xlsx')

workbook.save(excel_file_path)

print(f"所有数据已保存到：{excel_file_path}")

本文来自互联网用户投稿，该文观点仅代表作者本人，不代表本站立场。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如若转载，请注明出处：http://www.mzph.cn/news/853390.shtml

如若内容造成侵权/违法违规/事实不符，请联系多彩编程网进行投诉反馈email:809451989@qq.com，一经查实，立即删除！

AI办公自动化：kimi批量搜索提取PDF文档中特定文本内容

相关文章

C++ 19 之封装

掌握特劳特定位理论核心，明晰企业战略定位之重

C语言：头歌使用函数找出数组中的最大值

为什么微信输入法是比搜狗输入法更好的选择？

git 如何拉取最新代码

skywalking9.4 链路追踪

linux下C语言如何操作文件(三)

装备名称检索与推荐

微信公众号打通与登录的实现

airsim安装

玄机平台应急响应—MySQL应急

DeepDriving | CUDA编程-05：流和事件

ESP32 BLE学习（0） — 基础架构

linux git凭证管理

园区地图导航系统：技术原理、部署方案与智能化应用解析

zerotier-one自建根服务器方法一

MongoDB 多层级查询

智能化状态管理：自动状态流转处理模块

AI项目二十二：行人属性识别

Flutter 简化CustomPainter的绘制