استخراج النص

استخراج كل النص من PDF كملف نصي

تسحب أداة الاستخراج من pdfty كل محرف نصي من ملف PDF وتسلّمه كملف نصي عادي نظيف. إنها تتفوق على تحديد الكل والنسخ واللصق، الذي يخربط عادةً التخطيطات متعددة الأعمدة، ويُسقط مربعات النص، ويتعثر مع المستندات الطويلة — فالاستخراج يعالج الصفحات الخمسين كلها في تمريرة واحدة مع الحفاظ على ترتيب القراءة.

يعمل الاستخراج على PyMuPDF الذي يقرأ بنية النص الداخلية للملف مباشرة ويعيد بناء ترتيب القراءة الطبيعي — بما في ذلك التخطيطات ذات العمودين، والجداول، والرؤوس، والحواشي. وتمر يونيكود بالكامل سليمة: السيريلية، ولغات شرق آسيا، والعربية، والمحارف المشكولة. النتيجة مثالية لتغذية المستندات إلى أدوات الترجمة وفهارس البحث والمساعدات الذكية، وللاقتباس من الأوراق البحثية، ولعدّ الكلمات.

ملاحظة مهمة: تعمل هذه الأداة مع ملفات PDF التي تحتوي على طبقة نصية. أما المستندات الممسوحة ضوئيًا فهي مجرد صور للنص — مرّرها عبر أداة OCR لدينا (المدعومة بمحرك Tesseract) أولًا، ثم استخرج. مجاني للملفات حتى 20 ميغابايت و50 صفحة، بلا علامة مائية وبلا تسجيل. تُحذف الملفات نهائيًا خلال ساعة واحدة.

كيف يعمل

  1. 1

    ارفع ملف PDF

    اسحب وأفلت أو انقر للاختيار. حتى 20 ميغابايت و50 صفحة مجانًا.

  2. 2

    استخرج

    يقرأ PyMuPDF الطبقة النصية ويعيد بناء ترتيب القراءة. ثانية أو ثانيتان لمعظم الملفات.

  3. 3

    عاين

    راجع الصفحات الأولى من النص المستخرَج على الشاشة.

  4. 4

    نزّل ملف .txt

    ملف نصي عادي واحد، مع علامات لفواصل الصفحات.

  5. 5

    يُحذف خلال ساعة

    يُحذف ملفك وملف النص من خوادمنا خلال ساعة واحدة.

الأسئلة الشائعة

ملفك على الأرجح مسح ضوئي — صور للنص بلا طبقة نصية. مرّره عبر أداة OCR لدينا أولًا ثم استخرج.

أدوات ذات صلة