בירור | בחירת טקסט בpdf: יש או אין?
-
@הבל-הבלים התכוונת תצוגת ספר, לא תצוגה מפוצלת
-
@י.-פל.
ברור שיש!
אבל לא במסך מגע. -
@י.-פל. אני כבר לא מבין מי נגד מי, אבל הPDF מהמאגר של @יאיר-דניאל זה לא OCR, זה הטקסט המקורי שיוצא ג'יבריש
-
-
אתה יודע מה פירוש המילה OCR?...
הוא בהחלט עזר לי.
אני כתבתי שיוצא טקסט ג'יבריש, והוא ענה שזו לט בבעיה של אוצריא - אלא של שכבת הטקסט.@י.-פל. לא רבנו!
הוא דיבר על הש"ס שבמאגר שלי - ששם זה משובש.בש"ס של אוצריא זה תקין - פחות או יותר.
בכ"מ = מה שהוא כתב לא נכון מבחינה עובדתית ולשונית.
-
@י.-פל. לא רבנו!
הוא דיבר על הש"ס שבמאגר שלי - ששם זה משובש.בש"ס של אוצריא זה תקין - פחות או יותר.
בכ"מ = מה שהוא כתב לא נכון מבחינה עובדתית ולשונית.
בכ"מ = מה שהוא כתב לא נכון מחבינה עובדתית ולשונית.
דווקא לדעתי הוא צדק, יש הבדל מהותי בין השס שלך לשל אוצריא:
של אוצריא - גמרא מודפסת שנסרקה ועשו לה OCR [זיהוי תווים אופטי = חילוץ טקסט מתמונה] והפכו לקובץ PDF.
של המאגר שלך - קבצי ה-PDF הגולמיים של השס [כמו הדפסה לPDF מוורד], התווים מעולם לא עברו סריקה - הם שם מהייצוא שלו, אלא שבגלל שמדובר בקובץ גדול, עם הרבה פונטים שונים, ה"מילון" שאמור להגיד למחשב מה התו שמקודד פה אומר בפועל ב-UTF8 נדפק [או שהוא לא קיים] ולכן יוצר ג'יבריש [אופציה נוספת היא שהתוכנות לא יודעות לתמוך במילון הזה]. -
בכ"מ = מה שהוא כתב לא נכון מחבינה עובדתית ולשונית.
דווקא לדעתי הוא צדק, יש הבדל מהותי בין השס שלך לשל אוצריא:
של אוצריא - גמרא מודפסת שנסרקה ועשו לה OCR [זיהוי תווים אופטי = חילוץ טקסט מתמונה] והפכו לקובץ PDF.
של המאגר שלך - קבצי ה-PDF הגולמיים של השס [כמו הדפסה לPDF מוורד], התווים מעולם לא עברו סריקה - הם שם מהייצוא שלו, אלא שבגלל שמדובר בקובץ גדול, עם הרבה פונטים שונים, ה"מילון" שאמור להגיד למחשב מה התו שמקודד פה אומר בפועל ב-UTF8 נדפק [או שהוא לא קיים] ולכן יוצר ג'יבריש [אופציה נוספת היא שהתוכנות לא יודעות לתמוך במילון הזה].של המאגר שלך - קבצי ה-PDF הגולמיים של השס [כמו הדפסה לPDF מוורד], התווים מעולם לא עברו סריקה - הם שם מהייצוא שלו, אלא שבגלל שמדובר בקובץ גדול, עם הרבה פונטים שונים, ה"מילון" שאמור להגיד למחשב מה התו שמקודד פה אומר בפועל ב-UTF8 נדפק [או שהוא לא קיים] ולכן יוצר ג'יבריש [אופציה נוספת היא שהתוכנות לא יודעות לתמוך במילון הזה].
וזאת מניין לך?
מידיעה מהשערה או מזה שזה ג'יבריש?
בכל מקרה הנוסח "טקסט מקורי" הוא לא מדוייק - הטקסט המקורי זה מה שמוצג למשתמש, הוא התכוון לשכבת הטקסט הנסתרת. -
של המאגר שלך - קבצי ה-PDF הגולמיים של השס [כמו הדפסה לPDF מוורד], התווים מעולם לא עברו סריקה - הם שם מהייצוא שלו, אלא שבגלל שמדובר בקובץ גדול, עם הרבה פונטים שונים, ה"מילון" שאמור להגיד למחשב מה התו שמקודד פה אומר בפועל ב-UTF8 נדפק [או שהוא לא קיים] ולכן יוצר ג'יבריש [אופציה נוספת היא שהתוכנות לא יודעות לתמוך במילון הזה].
וזאת מניין לך?
מידיעה מהשערה או מזה שזה ג'יבריש?
בכל מקרה הנוסח "טקסט מקורי" הוא לא מדוייק - הטקסט המקורי זה מה שמוצג למשתמש, הוא התכוון לשכבת הטקסט הנסתרת.מידיעה מהשערה או מזה שזה ג'יבריש?
השערה מבוססת - אתה יכול לראות שזה לא סרוק, מה גם שהרזולוציה כמעט אינסופית => זה תוכן וקטורי [כמו פונט בוורד].
ניסיתי הרבה זמן לתקן את זה, לא הצלחתי... -
מידיעה מהשערה או מזה שזה ג'יבריש?
השערה מבוססת - אתה יכול לראות שזה לא סרוק, מה גם שהרזולוציה כמעט אינסופית => זה תוכן וקטורי [כמו פונט בוורד].
ניסיתי הרבה זמן לתקן את זה, לא הצלחתי...@arieldaniely
איך ניסית לתקן? -
@arieldaniely
איך ניסית לתקן? -
בכ"מ = מה שהוא כתב לא נכון מחבינה עובדתית ולשונית.
דווקא לדעתי הוא צדק, יש הבדל מהותי בין השס שלך לשל אוצריא:
של אוצריא - גמרא מודפסת שנסרקה ועשו לה OCR [זיהוי תווים אופטי = חילוץ טקסט מתמונה] והפכו לקובץ PDF.
של המאגר שלך - קבצי ה-PDF הגולמיים של השס [כמו הדפסה לPDF מוורד], התווים מעולם לא עברו סריקה - הם שם מהייצוא שלו, אלא שבגלל שמדובר בקובץ גדול, עם הרבה פונטים שונים, ה"מילון" שאמור להגיד למחשב מה התו שמקודד פה אומר בפועל ב-UTF8 נדפק [או שהוא לא קיים] ולכן יוצר ג'יבריש [אופציה נוספת היא שהתוכנות לא יודעות לתמוך במילון הזה].שלו, אלא שבגלל שמדובר בקובץ גדול, עם הרבה פונטים שונים, ה"מילון" שאמור להגיד למחשב מה התו שמקודד פה אומר בפועל ב-UTF8 נדפק [או שהוא לא קיים] ולכן יוצר ג'יבריש [אופציה נוספת היא שהתוכנות לא יודעות לתמוך במילון הזה].
לי ידוע שישנם תוכנות שמקודדות בכוונה את הטקסט המקורי כשמייצאים לPDF כדי שלא יוכלו להעתיק...
-
שלו, אלא שבגלל שמדובר בקובץ גדול, עם הרבה פונטים שונים, ה"מילון" שאמור להגיד למחשב מה התו שמקודד פה אומר בפועל ב-UTF8 נדפק [או שהוא לא קיים] ולכן יוצר ג'יבריש [אופציה נוספת היא שהתוכנות לא יודעות לתמוך במילון הזה].
לי ידוע שישנם תוכנות שמקודדות בכוונה את הטקסט המקורי כשמייצאים לPDF כדי שלא יוכלו להעתיק...
@דאנציג אני לא חושב שלמישהו הי' עניין להסתיר את הטקסט.
אם הי' כאן ענין למישהו, זה להסתיר את הPDF עצמו, לא את שכבת הטקסט... -
של המאגר שלך - קבצי ה-PDF הגולמיים של השס [כמו הדפסה לPDF מוורד], התווים מעולם לא עברו סריקה - הם שם מהייצוא שלו, אלא שבגלל שמדובר בקובץ גדול, עם הרבה פונטים שונים, ה"מילון" שאמור להגיד למחשב מה התו שמקודד פה אומר בפועל ב-UTF8 נדפק [או שהוא לא קיים] ולכן יוצר ג'יבריש [אופציה נוספת היא שהתוכנות לא יודעות לתמוך במילון הזה].
וזאת מניין לך?
מידיעה מהשערה או מזה שזה ג'יבריש?
בכל מקרה הנוסח "טקסט מקורי" הוא לא מדוייק - הטקסט המקורי זה מה שמוצג למשתמש, הוא התכוון לשכבת הטקסט הנסתרת.מידיעה מהשערה או מזה שזה ג'יבריש?
פשוט מאד. גם בגלל הרזולוציה כמו ש@arieldaniely כתב
וגם שאם תנסה לערוך את הטקסט בPDF XChange למשל תראה שאפשר להזיז או למחוק אותו, בשונה מהש"ס של אוצריא שזה מטפל רק בשכבה השקופה
ועי' פה ובהודעות לפני ואחרי -
מי רוצה לעבוד על זה?
https://github.com/Sivan22/pdf-missing-encoding-fixer-heb
שלום! נראה שהשיחה הזו מעניינת אותך, אבל עדיין אין לך חשבון.
נמאס לכם לגלול בין אותם הפוסטים בכל ביקור? כשנרשמים לחשבון, תמיד תחזרו בדיוק למקום שבו הייתם קודם, ותוכלו לבחור לקבל התראות על תגובות חדשות (בין אם במייל, ובין אם בהתראת פוש). תוכלו גם לשמור סימניות ולפרגן ב-upvote לפוסטים כדי להביע הערכה לחברי קהילה אחרים.
בעזרת התרומה שלך, הפוסט הזה יכול להיות אפילו טוב יותר 💗
הרשמה התחברות

