בירור | בחירת טקסט בpdf: יש או אין?
-
@יאיר-דניאל
תוכיח. -
@יאיר-דניאל
תוכיח. -
-
פוסט זה נמחק!
-
@pcinfogmach כתב בבירור | ocr בתוך התוכנה, ע״י גרור-ושחרר, בתוספת של 151mb - שווה?:
גם היה שם בחירת טקסט (אם כי לא מימין לשמאל) ובאוצריא משום מה אין בחירת טקסט כלל
גם מהתגובה של @יום-חדש-מתחיל נראה שהוא מסכים איתו.
משהו לא ברור לי: כשאני גורר מסומנים לי קטעים! (זה שזה לא לפי הטקסט, חשבתי עד עכשיו שזה בעייה בשכבת הטקסט, דאם לא תימא הכי, מדוע הקוביה כן נבחרת?)

-
@הבל-הבלים התכוונת תצוגת ספר, לא תצוגה מפוצלת
-
@י.-פל.
ברור שיש!
אבל לא במסך מגע. -
@י.-פל. אני כבר לא מבין מי נגד מי, אבל הPDF מהמאגר של @יאיר-דניאל זה לא OCR, זה הטקסט המקורי שיוצא ג'יבריש
-
-
אתה יודע מה פירוש המילה OCR?...
הוא בהחלט עזר לי.
אני כתבתי שיוצא טקסט ג'יבריש, והוא ענה שזו לט בבעיה של אוצריא - אלא של שכבת הטקסט.@י.-פל. לא רבנו!
הוא דיבר על הש"ס שבמאגר שלי - ששם זה משובש.בש"ס של אוצריא זה תקין - פחות או יותר.
בכ"מ = מה שהוא כתב לא נכון מבחינה עובדתית ולשונית.
-
@י.-פל. לא רבנו!
הוא דיבר על הש"ס שבמאגר שלי - ששם זה משובש.בש"ס של אוצריא זה תקין - פחות או יותר.
בכ"מ = מה שהוא כתב לא נכון מבחינה עובדתית ולשונית.
בכ"מ = מה שהוא כתב לא נכון מחבינה עובדתית ולשונית.
דווקא לדעתי הוא צדק, יש הבדל מהותי בין השס שלך לשל אוצריא:
של אוצריא - גמרא מודפסת שנסרקה ועשו לה OCR [זיהוי תווים אופטי = חילוץ טקסט מתמונה] והפכו לקובץ PDF.
של המאגר שלך - קבצי ה-PDF הגולמיים של השס [כמו הדפסה לPDF מוורד], התווים מעולם לא עברו סריקה - הם שם מהייצוא שלו, אלא שבגלל שמדובר בקובץ גדול, עם הרבה פונטים שונים, ה"מילון" שאמור להגיד למחשב מה התו שמקודד פה אומר בפועל ב-UTF8 נדפק [או שהוא לא קיים] ולכן יוצר ג'יבריש [אופציה נוספת היא שהתוכנות לא יודעות לתמוך במילון הזה]. -
בכ"מ = מה שהוא כתב לא נכון מחבינה עובדתית ולשונית.
דווקא לדעתי הוא צדק, יש הבדל מהותי בין השס שלך לשל אוצריא:
של אוצריא - גמרא מודפסת שנסרקה ועשו לה OCR [זיהוי תווים אופטי = חילוץ טקסט מתמונה] והפכו לקובץ PDF.
של המאגר שלך - קבצי ה-PDF הגולמיים של השס [כמו הדפסה לPDF מוורד], התווים מעולם לא עברו סריקה - הם שם מהייצוא שלו, אלא שבגלל שמדובר בקובץ גדול, עם הרבה פונטים שונים, ה"מילון" שאמור להגיד למחשב מה התו שמקודד פה אומר בפועל ב-UTF8 נדפק [או שהוא לא קיים] ולכן יוצר ג'יבריש [אופציה נוספת היא שהתוכנות לא יודעות לתמוך במילון הזה].של המאגר שלך - קבצי ה-PDF הגולמיים של השס [כמו הדפסה לPDF מוורד], התווים מעולם לא עברו סריקה - הם שם מהייצוא שלו, אלא שבגלל שמדובר בקובץ גדול, עם הרבה פונטים שונים, ה"מילון" שאמור להגיד למחשב מה התו שמקודד פה אומר בפועל ב-UTF8 נדפק [או שהוא לא קיים] ולכן יוצר ג'יבריש [אופציה נוספת היא שהתוכנות לא יודעות לתמוך במילון הזה].
וזאת מניין לך?
מידיעה מהשערה או מזה שזה ג'יבריש?
בכל מקרה הנוסח "טקסט מקורי" הוא לא מדוייק - הטקסט המקורי זה מה שמוצג למשתמש, הוא התכוון לשכבת הטקסט הנסתרת. -
של המאגר שלך - קבצי ה-PDF הגולמיים של השס [כמו הדפסה לPDF מוורד], התווים מעולם לא עברו סריקה - הם שם מהייצוא שלו, אלא שבגלל שמדובר בקובץ גדול, עם הרבה פונטים שונים, ה"מילון" שאמור להגיד למחשב מה התו שמקודד פה אומר בפועל ב-UTF8 נדפק [או שהוא לא קיים] ולכן יוצר ג'יבריש [אופציה נוספת היא שהתוכנות לא יודעות לתמוך במילון הזה].
וזאת מניין לך?
מידיעה מהשערה או מזה שזה ג'יבריש?
בכל מקרה הנוסח "טקסט מקורי" הוא לא מדוייק - הטקסט המקורי זה מה שמוצג למשתמש, הוא התכוון לשכבת הטקסט הנסתרת.מידיעה מהשערה או מזה שזה ג'יבריש?
השערה מבוססת - אתה יכול לראות שזה לא סרוק, מה גם שהרזולוציה כמעט אינסופית => זה תוכן וקטורי [כמו פונט בוורד].
ניסיתי הרבה זמן לתקן את זה, לא הצלחתי... -
מידיעה מהשערה או מזה שזה ג'יבריש?
השערה מבוססת - אתה יכול לראות שזה לא סרוק, מה גם שהרזולוציה כמעט אינסופית => זה תוכן וקטורי [כמו פונט בוורד].
ניסיתי הרבה זמן לתקן את זה, לא הצלחתי...@arieldaniely
איך ניסית לתקן? -
@arieldaniely
איך ניסית לתקן? -
בכ"מ = מה שהוא כתב לא נכון מחבינה עובדתית ולשונית.
דווקא לדעתי הוא צדק, יש הבדל מהותי בין השס שלך לשל אוצריא:
של אוצריא - גמרא מודפסת שנסרקה ועשו לה OCR [זיהוי תווים אופטי = חילוץ טקסט מתמונה] והפכו לקובץ PDF.
של המאגר שלך - קבצי ה-PDF הגולמיים של השס [כמו הדפסה לPDF מוורד], התווים מעולם לא עברו סריקה - הם שם מהייצוא שלו, אלא שבגלל שמדובר בקובץ גדול, עם הרבה פונטים שונים, ה"מילון" שאמור להגיד למחשב מה התו שמקודד פה אומר בפועל ב-UTF8 נדפק [או שהוא לא קיים] ולכן יוצר ג'יבריש [אופציה נוספת היא שהתוכנות לא יודעות לתמוך במילון הזה].שלו, אלא שבגלל שמדובר בקובץ גדול, עם הרבה פונטים שונים, ה"מילון" שאמור להגיד למחשב מה התו שמקודד פה אומר בפועל ב-UTF8 נדפק [או שהוא לא קיים] ולכן יוצר ג'יבריש [אופציה נוספת היא שהתוכנות לא יודעות לתמוך במילון הזה].
לי ידוע שישנם תוכנות שמקודדות בכוונה את הטקסט המקורי כשמייצאים לPDF כדי שלא יוכלו להעתיק...
שלום! נראה שהשיחה הזו מעניינת אותך, אבל עדיין אין לך חשבון.
נמאס לכם לגלול בין אותם הפוסטים בכל ביקור? כשנרשמים לחשבון, תמיד תחזרו בדיוק למקום שבו הייתם קודם, ותוכלו לבחור לקבל התראות על תגובות חדשות (בין אם במייל, ובין אם בהתראת פוש). תוכלו גם לשמור סימניות ולפרגן ב-upvote לפוסטים כדי להביע הערכה לחברי קהילה אחרים.
בעזרת התרומה שלך, הפוסט הזה יכול להיות אפילו טוב יותר 💗
הרשמה התחברות


