read_pdf.py 995 B

1234567891011121314151617181920212223242526272829303132333435
  1. import pdfplumber
  2. import sys
  3. import os
  4. def read_pdf(pdf_path):
  5. text = ""
  6. try:
  7. with pdfplumber.open(pdf_path) as pdf:
  8. for page in pdf.pages:
  9. text += page.extract_text() or ""
  10. text += "\n\n"
  11. return text
  12. except Exception as e:
  13. return f"Error: {e}"
  14. if __name__ == "__main__":
  15. if len(sys.argv) < 2:
  16. print("Usage: python read_pdf.py <pdf_file>")
  17. sys.exit(1)
  18. pdf_file = sys.argv[1]
  19. if not os.path.exists(pdf_file):
  20. print(f"File not found: {pdf_file}")
  21. sys.exit(1)
  22. content = read_pdf(pdf_file)
  23. # 保存到临时文件,避免编码问题
  24. import tempfile
  25. import os
  26. temp_file = os.path.join(tempfile.gettempdir(), 'pdf_content.txt')
  27. with open(temp_file, 'w', encoding='utf-8') as f:
  28. f.write(content)
  29. print(f"Content saved to: {temp_file}")
  30. # 只打印关键信息
  31. print(content[:500] if content else "No content extracted")