FreePDF logoFreePDF

Cách trích xuất ảnh từ PDF (không phải ảnh chụp màn hình trang)

Bởi đội ngũ FreePDF ·

Nhà cung cấp gửi một cuốn catalogue 40 trang và bạn chỉ cần ảnh sản phẩm trong đó. Chụp màn hình từng tấm là vứt bỏ độ phân giải, còn chuyển PDF sang JPG thì trả về nguyên trang với chữ nghĩa in kèm. Thứ bạn cần là chính những tấm ảnh đó: các tệp mà ai đó đã kéo vào tài liệu trước khi xuất ra PDF.

Trích ảnh không phải là chuyển trang

Đây là hai việc khác nhau mà tên công cụ lại giống nhau đến khó chịu, nên cần nói rõ bạn đang cần cái nào.

  • PDF sang JPG vẽ mỗi trang thành một ảnh phẳng duy nhất: chữ, ảnh, số trang, tất cả, ở độ phân giải bạn chọn.
  • Trích xuất ảnh đi vào bên trong tệp và lấy từng ảnh nhúng ra thành tệp riêng, đúng độ phân giải lúc nó được lưu.

Không có khâu mã hoá lại nào trên đường ra. Một tấm ảnh 3000×2000 trở về vẫn là 3000×2000 dù trên bản dàn trang nó chỉ nhỏ bằng con tem, bởi PDF vẫn giữ nguyên ảnh gốc và chỉ hiển thị nhỏ đi. Đây thường là bất ngờ dễ chịu: ảnh lớn hơn nhiều so với vẻ ngoài trên trang giấy.

Trong tệp ZIP có gì

Mọi thứ trả về trong một tệp ZIP duy nhất để bạn khỏi bấm tải 60 lần. Mỗi tệp được đặt tên theo trang chứa nó, theo thứ tự xuất hiện, nên page7_23_Im4.png là đối tượng ảnh thứ tư ở trang 7. Sắp xếp thư mục theo tên là bạn có ảnh theo đúng thứ tự đọc, rất dễ đối chiếu ngược lại với tài liệu.

Định dạng đúng như PDF đã lưu, thường là PNG hoặc JPG. Số tệp có thể nhiều hơn bạn tưởng: một nền trang, một logo lặp ở đầu mỗi trang, một đường kẻ mảnh được lưu dưới dạng ảnh hai điểm ảnh. Cứ lướt qua rồi xoá, đừng mặc định mỗi tệp là một tấm ảnh.

Khi tấm ảnh bạn cần không ra

Công cụ chỉ tìm ảnh raster, loại tạo bởi các điểm ảnh. Có những thứ trông như ảnh trên trang nhưng không được lưu theo cách đó:

  • Logo, biểu tượng và biểu đồ vẽ bằng vector. Biểu đồ xuất từ Illustrator hay do công cụ báo cáo sinh ra thường là một tập lệnh vẽ chứ không phải ảnh. Không có đối tượng ảnh nào để lấy, và công cụ sẽ báo là không tìm thấy tấm nào.
  • Ảnh bị cắt thành dải. Một số phần mềm dàn trang xẻ ảnh lớn thành các dải ngang khi ghi PDF. Bạn nhận được các dải, đúng thứ tự, và phải tự ghép lại.
  • Ảnh bị cắt cúp trong bản dàn trang. Việc cắt cúp chỉ là chỉ dẫn hiển thị, nên bạn nhận lại ảnh gốc trọn vẹn, gồm cả phần bị che trên trang.

Với mọi trường hợp thuộc ý đầu tiên, hãy dựng cả trang thành ảnh rồi cắt lấy phần cần. Bạn mất độ phân giải gốc, nhưng một trang dựng ở 300 DPI từ biểu đồ vector vẫn đủ nét cho một slide hay một tài liệu.

Tài liệu quét thì khác

Nếu PDF ra từ máy quét hoặc ứng dụng quét trên điện thoại, mỗi trang là một tấm ảnh lớn. Trích xuất sẽ cho đúng thứ đó: mỗi trang một tấm ảnh, chính là bản quét, ở độ phân giải lúc quét. Nó thực sự hữu ích khi bạn muốn lấy lại các bản quét gốc từ một tập ai đó đã gộp, và vô dụng nếu bạn định tách riêng một hình vẽ in trên trang. Với hình vẽ đó, hãy lấy ảnh trang rồi cắt.

Câu hỏi thường gặp

Ảnh trích ra có kém hơn ảnh trong PDF không?

Không. Dữ liệu ảnh nhúng được chép ra nguyên trạng chứ không lưu lại, nên không có vòng nén thứ hai. Nếu tấm ảnh đã bị ép xuống 72 DPI ngay từ lúc tạo tài liệu thì đó chính là thứ bạn nhận về. Việc trích xuất không làm nó tệ đi, nhưng cũng không thể dựng lại chi tiết mà PDF chưa bao giờ có.

Tôi có thể lấy ảnh của riêng một trang không?

Không trực tiếp, nhưng chỉ mất hai bước: tách trang đó ra thành PDF riêng trước, rồi chạy trích xuất ảnh trên tệp ấy. Với tài liệu dài, cách này thường nhanh hơn việc bới một tệp ZIP đầy tiêu đề trang và đường kẻ, mà tên tệp cũng gọn gàng hơn.

Công cụ miễn phí liên quan