כל הכלים החינמיים
חילוץ טקסט מ-PDF ותיקון עברית הפוכה — כשההעתקה יוצאת ״םולש״
מעתיקים פסקה מ-PDF, מדביקים בוורד, ומקבלים אותיות בסדר הפוך. זה קורה כי חלק מהתוכנות שמייצרות PDF שומרות את האותיות בסדר שבו הן מצוירות על הדף ולא בסדר שבו נכתבו. הכלי שולף את הטקסט, מזהה אם הוא הפוך, ומתקן — בלי לשבור מספרים ומילים באנגלית שבתוכו.
הקובץ נשאר במחשב שלכם. הוא אינו נשלח אלינו ואינו נשמר אצלנו.
שאלות נפוצות
- הקובץ נשלח אליכם לשרת?
- לא. כל העיבוד קורה בדפדפן שלכם, במחשב שלכם. הקובץ אינו נשלח לשום מקום, ואנחנו לא רואים אותו ולא שומרים אותו. אפשר לוודא את זה: מנתקים את האינטרנט אחרי שהעמוד נטען, והכלי ימשיך לעבוד.
- איך אתם יודעים שהטקסט הפוך?
- לפי כללי הכתיב: אות סופית (ם, ן, ץ) מופיעה בעברית רק בסוף מילה. כשהיא מופיעה בתחילת מילים, הטקסט הפוך. כשאין עדות לכאן או לכאן, אנחנו מניחים שהטקסט תקין ולא נוגעים בו.
- המספרים לא יתהפכו?
- לא. רצפי ספרות ואותיות באנגלית מוחזרים לסדרם — אחרת "25 ספרים" היה הופך ל"52 ספרים", וזו טעות שנראית נכונה לגמרי.
- לא יוצא שום טקסט, מה עכשיו?
- כנראה שהקובץ הוא סריקה — כלומר תמונה של דף ולא טקסט. במקרה כזה צריך זיהוי תווים, וזה מה שהכלי "דיו" באתר עושה.
הקובץ הוא סריקה או כתב יד ולא יוצא ממנו טקסט?
דיו — פענוח כתב יד
כתב יד וסריקות ישנות הופכים לטקסט דיגיטלי שאפשר לחפש בו ולערוך אותו.
לכלי דיו