تبقى الملفات على الجهاز
تُعالَج الملفات في المتصفح ولا تُرفع إلى خوادمنا. قد ينزّل الموقع محركات المعالجة ويرسل أحداث الاستخدام أو الملاحظات دون محتوى الملفات.
كيف نتعامل مع البياناتPDF إلى نص
استخراج النص من PDF: نسخ الطبقة النصية الموجودة في نموذج أو دليل قابل للبحث إلى ملف نص عادي يمكن لصقه في الملاحظات. تحتاج المسوح إلى OCR أولًا.
مثال اصطناعي — يُرجى مراجعة إعدادات العملية قبل التشغيل.
تبقى المستندات على هذا الجهاز. لا تتضمن عمليات تنزيل الأدوات وإحصاءات الاستخدام محتوى الملفات.
الحدود على الجهاز: الحد الأقصى للملف الواحد: 10 MB
تُعالج الملفات داخل المتصفح. لا تُرفع إلى هذا الموقع.
دليل عملي
إعادة استخدام الكلمات الموجودة في PDF.
- اختيار ملف PDF بنص قابل للتحديد، لا مسح لصفحات مطبوعة.
- استخراج النص ومراجعة فواصل الصفحات وترتيب القراءة.
- نسخ نتيجة TXT أو تنزيلها ومقارنة القيم المهمة بملف PDF.
تجربة هذا المثال
استخراج النص من دليل طلب قابل للبحث من صفحتين، والتحقق من ظهور تسميات الحقول والتعليمات في نتيجة TXT بترتيب صالح للاستخدام.
قبل
- نص PDF قابل للتحديد
بعد
- نص عادي بصيغة .txt
قبل البدء: يقرأ هذا النص القابل للتحديد المضمن؛ وتحتاج الصفحات الممسوحة إلى OCR، وقد لا تتبع الأعمدة ترتيبها المرئي.
المتابعة بملف PDF المصدرما الذي يتم الحصول عليه
استخراج النص المضمّن إلى ملف TXT. تحتاج الصفحات الممسوحة ضوئيًا إلى OCR؛ وقد يختلف ترتيب القراءة في المصدر عن التخطيط المرئي.
الحدود والتفاصيل المهمة
10 MiB كحد أقصى للمدخلات، و200 صفحة، و4 MiB لمخرجات النص. تُبلغ المستندات الممسوحة ضوئيًا التي تفتقر إلى طبقة نصية عن خطأ بدلًا من استخراج ناجح زائف. قد لا يطابق ترتيب القراءة والأعمدة والخطوط التخطيط المرئي. هذا ليس OCR وليس تحويلًا من PDF إلى Word.
مثال
استخراج النص من تقرير قابل للبحث، ومراجعته في حقل النتيجة، ثم نسخه أو تنزيله. تبقى ملفات PDF الأصلية متاحة بعد نتيجة النص.