| 1234567891011121314151617181920212223242526272829303132333435 |
- import pdfplumber
- import sys
- import os
- def read_pdf(pdf_path):
- text = ""
- try:
- with pdfplumber.open(pdf_path) as pdf:
- for page in pdf.pages:
- text += page.extract_text() or ""
- text += "\n\n"
- return text
- except Exception as e:
- return f"Error: {e}"
- if __name__ == "__main__":
- if len(sys.argv) < 2:
- print("Usage: python read_pdf.py <pdf_file>")
- sys.exit(1)
-
- pdf_file = sys.argv[1]
- if not os.path.exists(pdf_file):
- print(f"File not found: {pdf_file}")
- sys.exit(1)
-
- content = read_pdf(pdf_file)
- # 保存到临时文件,避免编码问题
- import tempfile
- import os
- temp_file = os.path.join(tempfile.gettempdir(), 'pdf_content.txt')
- with open(temp_file, 'w', encoding='utf-8') as f:
- f.write(content)
- print(f"Content saved to: {temp_file}")
- # 只打印关键信息
- print(content[:500] if content else "No content extracted")
|