目前市面上大部分都是pdf文档,要想转换成能训练的文本,调研了各种工具。
觉得MinerU确实不错。
参考此链接进行操作
MinerU/docs/README_Ubuntu_CUDA_Acceleration_en_US.md at master · opendatalab/MinerU · GitHub
需要注意的几个点:
1. 使用root账户安装的,配置文件在此处 /root/magic-pdf.json
2. 配置文件cuda,使能表格的配置文件参考为
{"bucket_info": {"bucket-name-1": ["ak","sk","endpoint"],"bucket-name-2": ["ak","sk"