赞
踩
在InternStudio平台中选择A100 (1/4)
的配置,镜像选择Cuda11.7-conda
,可以选择已有的开发机langchain
;
mkdir /root/pdf_project
git clone https://gitee.com/tcexeexe/pdf-reading-assistant.git
# 迭代创建虚拟项目空间和model目录
ln -sf /root/pdf_project /home/tcexeexe
# 建立分词数据目录
mkdir -p /root/pdf_project/data/pdf-reading-assistant/data_base/vector_db/pdf
conda activate InternLM
pip install PyPDF2 pypdf tiktoken transformers_stream_generator
mkdir -p /home/tcexeexe/data/model
ln -sf /root/data/model/sentence-transformer /home/tcexeexe/data/model/sentence-transformer
Note:
/home/tcexeexe/data/model/sentence-transformer
:此路径来自于make_knowledge_repository.pypython /root/pdf_project/data/pdf-reading-assistant/make_knowledge_repository.py
以上脚本会生成数据库文件chroma.sqlite3
,知识库中指定的文件内容就会存到其中,之前使用的PDF文件就不需要了。
PyPDF2
之后仍然会遇到"ModuleNotFoundError: No module named ‘PyPDF2’"的错误我们猜测这个错误是因为PyPDF2跟pypdf的重复安装导致的,为了验证这个问题,我们可以尝试使用绝对路径运行make_knowledge_repository.py
:
/root/.conda/envs/InternLM/bin/python \
/root/pdf_project/data/pdf-reading-assistant/make_knowledge_repository.py
我们在InternStudio上做实验时发现:
InternStudio会不定时地删除上传的PDF文件;
我们咨询了一下队长:
队长回复说这是InternStudio一种已知的问题;
python /root/pdf_project/data/pdf-reading-assistant/web_demo.py
ssh-keygen -t rsa
通过网页访问:127.0.0.1:7860
提示学习是什么
python -m pip install --upgrade pip
Copyright © 2003-2013 www.wpsshop.cn 版权所有,并保留所有权利。