דילוג לתוכן
0
  • דף הבית
  • חוקי הפורום
  • מדריכים
  • פוסטים אחרונים
  • לא נפתר
  • תגיות
  • פופולרי
  • משתמשים
  • תרומות לאוצריא
  • צור קשר
  • דף הבית
  • חוקי הפורום
  • מדריכים
  • פוסטים אחרונים
  • לא נפתר
  • תגיות
  • פופולרי
  • משתמשים
  • תרומות לאוצריא
  • צור קשר
עיצובים
  • בהיר
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • כהה
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • ברירת מחדל (ללא עיצוב (ברירת מחדל))
  • ללא עיצוב (ברירת מחדל)
כיווץ
לוגו אתר

פורום אוצריא

אוצריא - דף הבית
|
קח שותפות בהוספת ספרים
|
תרום לאוצריא
  1. דף הבית
  2. בעיות - תוכנת אוצריא
  3. בירור | בחירת טקסט בpdf: יש או אין?

בירור | בחירת טקסט בpdf: יש או אין?

מתוזמן נעוץ נעול הועבר בעיות - תוכנת אוצריא
תוכנת אוצריאpdfבחירת-טקסטocr
55 פוסטים 11 כותבים 1.2k צפיות 9 עוקבים
  • מהישן לחדש
  • מהחדש לישן
  • הכי הרבה הצבעות
    תגובה
    • תגובה כנושא
    התחברו כדי לפרסם תגובה
    נושא זה נמחק. רק משתמשים עם הרשאות מתאימות יוכלו לצפות בו.
    • י. פל.י י. פל.

      אני לא מבין, באמת!
      בpdf המובנה לא ניתן לבחור טקסט - כי אין!
      בpdf שלך הצלחתי לבחור טקסט - כי יש!
      יש בעיה שונה. - שהוא משובש, אבל נושא השרשור הוא:

      בירור בחירת טקסט בpdf: יש או אין?

      מישהו מוכן לענות לי?

      מ
      מ
      מענין לשמוע
      כתב ב נערך לאחרונה על ידי
      #18

      @י.-פל.
      ברור שיש!
      אבל לא במסך מגע.

      תגובה 1 תגובה אחרונה
      0
      • ד
        ד
        דורש טוב
        כתב ב נערך לאחרונה על ידי
        #19

        @י.-פל. אני כבר לא מבין מי נגד מי, אבל הPDF מהמאגר של @יאיר-דניאל זה לא OCR, זה הטקסט המקורי שיוצא ג'יבריש

        יאיר דניאלי תגובה 1 תגובה אחרונה
        1
        • ד דורש טוב

          @י.-פל. אני כבר לא מבין מי נגד מי, אבל הPDF מהמאגר של @יאיר-דניאל זה לא OCR, זה הטקסט המקורי שיוצא ג'יבריש

          יאיר דניאלי
          יאיר דניאלי
          יאיר דניאל
          תורם לאוצריא ניהול תוספים
          כתב ב נערך לאחרונה על ידי
          #20

          @דורש-טוב כתב:

          זה לא OCR, זה הטקסט המקורי שיוצא ג'יבריש

          אתה יודע מה פירוש המילה OCR?...
          למה שאתה קורא "הטקסט המקורי" קוראים בעברית "שכבת טקסט" ובאנגלית קוראים לזיהוי תויים OCR...
          והשכבת הטקסט שם היא באמת משובשת, עד שיבוא מישהו ויקח על עצמו לעשות לזה OCR = זיהוי תווים.

          י. פל.י תגובה 1 תגובה אחרונה
          1
          • יאיר דניאלי יאיר דניאל

            @דורש-טוב כתב:

            זה לא OCR, זה הטקסט המקורי שיוצא ג'יבריש

            אתה יודע מה פירוש המילה OCR?...
            למה שאתה קורא "הטקסט המקורי" קוראים בעברית "שכבת טקסט" ובאנגלית קוראים לזיהוי תויים OCR...
            והשכבת הטקסט שם היא באמת משובשת, עד שיבוא מישהו ויקח על עצמו לעשות לזה OCR = זיהוי תווים.

            י. פל.י
            י. פל.י
            י. פל.
            כתב ב נערך לאחרונה על ידי י. פל.
            #21

            @יאיר-דניאל כתב:

            אתה יודע מה פירוש המילה OCR?...

            הוא בהחלט עזר לי.
            אני כתבתי שיוצא טקסט ג'יבריש, והוא ענה שזו לט בבעיה של אוצריא - אלא של שכבת הטקסט.

            יאיר דניאלי תגובה 1 תגובה אחרונה
            0
            • י. פל.י י. פל.

              @יאיר-דניאל כתב:

              אתה יודע מה פירוש המילה OCR?...

              הוא בהחלט עזר לי.
              אני כתבתי שיוצא טקסט ג'יבריש, והוא ענה שזו לט בבעיה של אוצריא - אלא של שכבת הטקסט.

              יאיר דניאלי
              יאיר דניאלי
              יאיר דניאל
              תורם לאוצריא ניהול תוספים
              כתב ב נערך לאחרונה על ידי יאיר דניאל
              #22

              @י.-פל. לא רבנו!
              הוא דיבר על הש"ס שבמאגר שלי - ששם זה משובש.

              בש"ס של אוצריא זה תקין - פחות או יותר.

              בכ"מ = מה שהוא כתב לא נכון מבחינה עובדתית ולשונית.

              A תגובה 1 תגובה אחרונה
              0
              • יאיר דניאלי יאיר דניאל

                @י.-פל. לא רבנו!
                הוא דיבר על הש"ס שבמאגר שלי - ששם זה משובש.

                בש"ס של אוצריא זה תקין - פחות או יותר.

                בכ"מ = מה שהוא כתב לא נכון מבחינה עובדתית ולשונית.

                A
                A
                arieldaniely
                מפתח
                כתב ב נערך לאחרונה על ידי arieldaniely
                #23

                @יאיר-דניאל כתב:

                בכ"מ = מה שהוא כתב לא נכון מחבינה עובדתית ולשונית.

                דווקא לדעתי הוא צדק, יש הבדל מהותי בין השס שלך לשל אוצריא:
                של אוצריא - גמרא מודפסת שנסרקה ועשו לה OCR [זיהוי תווים אופטי = חילוץ טקסט מתמונה] והפכו לקובץ PDF.
                של המאגר שלך - קבצי ה-PDF הגולמיים של השס [כמו הדפסה לPDF מוורד], התווים מעולם לא עברו סריקה - הם שם מהייצוא שלו, אלא שבגלל שמדובר בקובץ גדול, עם הרבה פונטים שונים, ה"מילון" שאמור להגיד למחשב מה התו שמקודד פה אומר בפועל ב-UTF8 נדפק [או שהוא לא קיים] ולכן יוצר ג'יבריש [אופציה נוספת היא שהתוכנות לא יודעות לתמוך במילון הזה].

                יאיר דניאלי דאנציגד 2 תגובות תגובה אחרונה
                1
                • A arieldaniely

                  @יאיר-דניאל כתב:

                  בכ"מ = מה שהוא כתב לא נכון מחבינה עובדתית ולשונית.

                  דווקא לדעתי הוא צדק, יש הבדל מהותי בין השס שלך לשל אוצריא:
                  של אוצריא - גמרא מודפסת שנסרקה ועשו לה OCR [זיהוי תווים אופטי = חילוץ טקסט מתמונה] והפכו לקובץ PDF.
                  של המאגר שלך - קבצי ה-PDF הגולמיים של השס [כמו הדפסה לPDF מוורד], התווים מעולם לא עברו סריקה - הם שם מהייצוא שלו, אלא שבגלל שמדובר בקובץ גדול, עם הרבה פונטים שונים, ה"מילון" שאמור להגיד למחשב מה התו שמקודד פה אומר בפועל ב-UTF8 נדפק [או שהוא לא קיים] ולכן יוצר ג'יבריש [אופציה נוספת היא שהתוכנות לא יודעות לתמוך במילון הזה].

                  יאיר דניאלי
                  יאיר דניאלי
                  יאיר דניאל
                  תורם לאוצריא ניהול תוספים
                  כתב ב נערך לאחרונה על ידי
                  #24

                  @arieldaniely כתב:

                  של המאגר שלך - קבצי ה-PDF הגולמיים של השס [כמו הדפסה לPDF מוורד], התווים מעולם לא עברו סריקה - הם שם מהייצוא שלו, אלא שבגלל שמדובר בקובץ גדול, עם הרבה פונטים שונים, ה"מילון" שאמור להגיד למחשב מה התו שמקודד פה אומר בפועל ב-UTF8 נדפק [או שהוא לא קיים] ולכן יוצר ג'יבריש [אופציה נוספת היא שהתוכנות לא יודעות לתמוך במילון הזה].

                  וזאת מניין לך?
                  מידיעה מהשערה או מזה שזה ג'יבריש?
                  בכל מקרה הנוסח "טקסט מקורי" הוא לא מדוייק - הטקסט המקורי זה מה שמוצג למשתמש, הוא התכוון לשכבת הטקסט הנסתרת.

                  A ד 2 תגובות תגובה אחרונה
                  0
                  • יאיר דניאלי יאיר דניאל

                    @arieldaniely כתב:

                    של המאגר שלך - קבצי ה-PDF הגולמיים של השס [כמו הדפסה לPDF מוורד], התווים מעולם לא עברו סריקה - הם שם מהייצוא שלו, אלא שבגלל שמדובר בקובץ גדול, עם הרבה פונטים שונים, ה"מילון" שאמור להגיד למחשב מה התו שמקודד פה אומר בפועל ב-UTF8 נדפק [או שהוא לא קיים] ולכן יוצר ג'יבריש [אופציה נוספת היא שהתוכנות לא יודעות לתמוך במילון הזה].

                    וזאת מניין לך?
                    מידיעה מהשערה או מזה שזה ג'יבריש?
                    בכל מקרה הנוסח "טקסט מקורי" הוא לא מדוייק - הטקסט המקורי זה מה שמוצג למשתמש, הוא התכוון לשכבת הטקסט הנסתרת.

                    A
                    A
                    arieldaniely
                    מפתח
                    כתב ב נערך לאחרונה על ידי
                    #25

                    @יאיר-דניאל כתב:

                    מידיעה מהשערה או מזה שזה ג'יבריש?

                    השערה מבוססת - אתה יכול לראות שזה לא סרוק, מה גם שהרזולוציה כמעט אינסופית => זה תוכן וקטורי [כמו פונט בוורד].
                    ניסיתי הרבה זמן לתקן את זה, לא הצלחתי...

                    י. פל.י תגובה 1 תגובה אחרונה
                    3
                    • A arieldaniely

                      @יאיר-דניאל כתב:

                      מידיעה מהשערה או מזה שזה ג'יבריש?

                      השערה מבוססת - אתה יכול לראות שזה לא סרוק, מה גם שהרזולוציה כמעט אינסופית => זה תוכן וקטורי [כמו פונט בוורד].
                      ניסיתי הרבה זמן לתקן את זה, לא הצלחתי...

                      י. פל.י
                      י. פל.י
                      י. פל.
                      כתב ב נערך לאחרונה על ידי
                      #26

                      @arieldaniely
                      איך ניסית לתקן?

                      A תגובה 1 תגובה אחרונה
                      0
                      • י. פל.י י. פל.

                        @arieldaniely
                        איך ניסית לתקן?

                        A
                        A
                        arieldaniely
                        מפתח
                        כתב ב נערך לאחרונה על ידי
                        #27

                        @י.-פל. את ה-PDF שלו? לתקן את המילון, GPT יצר לי איזשהו כלי שחילץ את כל סוגי התווים שיש בו, מציג לי כמה דוגמאות של כל אחד ואני מגדיר מה הוא אמור להיות, אבל זה לא עזר...

                        תגובה 1 תגובה אחרונה
                        1
                        • A arieldaniely

                          @יאיר-דניאל כתב:

                          בכ"מ = מה שהוא כתב לא נכון מחבינה עובדתית ולשונית.

                          דווקא לדעתי הוא צדק, יש הבדל מהותי בין השס שלך לשל אוצריא:
                          של אוצריא - גמרא מודפסת שנסרקה ועשו לה OCR [זיהוי תווים אופטי = חילוץ טקסט מתמונה] והפכו לקובץ PDF.
                          של המאגר שלך - קבצי ה-PDF הגולמיים של השס [כמו הדפסה לPDF מוורד], התווים מעולם לא עברו סריקה - הם שם מהייצוא שלו, אלא שבגלל שמדובר בקובץ גדול, עם הרבה פונטים שונים, ה"מילון" שאמור להגיד למחשב מה התו שמקודד פה אומר בפועל ב-UTF8 נדפק [או שהוא לא קיים] ולכן יוצר ג'יבריש [אופציה נוספת היא שהתוכנות לא יודעות לתמוך במילון הזה].

                          דאנציגד
                          דאנציגד
                          דאנציג
                          תורם לאוצריא
                          כתב ב נערך לאחרונה על ידי
                          #28

                          @arieldaniely כתב:

                          שלו, אלא שבגלל שמדובר בקובץ גדול, עם הרבה פונטים שונים, ה"מילון" שאמור להגיד למחשב מה התו שמקודד פה אומר בפועל ב-UTF8 נדפק [או שהוא לא קיים] ולכן יוצר ג'יבריש [אופציה נוספת היא שהתוכנות לא יודעות לתמוך במילון הזה].

                          לי ידוע שישנם תוכנות שמקודדות בכוונה את הטקסט המקורי כשמייצאים לPDF כדי שלא יוכלו להעתיק...

                          יום חדש מתחילי תגובה 1 תגובה אחרונה
                          0
                          • דאנציגד דאנציג

                            @arieldaniely כתב:

                            שלו, אלא שבגלל שמדובר בקובץ גדול, עם הרבה פונטים שונים, ה"מילון" שאמור להגיד למחשב מה התו שמקודד פה אומר בפועל ב-UTF8 נדפק [או שהוא לא קיים] ולכן יוצר ג'יבריש [אופציה נוספת היא שהתוכנות לא יודעות לתמוך במילון הזה].

                            לי ידוע שישנם תוכנות שמקודדות בכוונה את הטקסט המקורי כשמייצאים לPDF כדי שלא יוכלו להעתיק...

                            יום חדש מתחילי
                            יום חדש מתחילי
                            יום חדש מתחיל
                            מנהל ספריית אוצריא
                            כתב ב נערך לאחרונה על ידי
                            #29

                            @דאנציג אני לא חושב שלמישהו הי' עניין להסתיר את הטקסט.
                            אם הי' כאן ענין למישהו, זה להסתיר את הPDF עצמו, לא את שכבת הטקסט...

                            תגובה 1 תגובה אחרונה
                            0
                            • יאיר דניאלי יאיר דניאל

                              @arieldaniely כתב:

                              של המאגר שלך - קבצי ה-PDF הגולמיים של השס [כמו הדפסה לPDF מוורד], התווים מעולם לא עברו סריקה - הם שם מהייצוא שלו, אלא שבגלל שמדובר בקובץ גדול, עם הרבה פונטים שונים, ה"מילון" שאמור להגיד למחשב מה התו שמקודד פה אומר בפועל ב-UTF8 נדפק [או שהוא לא קיים] ולכן יוצר ג'יבריש [אופציה נוספת היא שהתוכנות לא יודעות לתמוך במילון הזה].

                              וזאת מניין לך?
                              מידיעה מהשערה או מזה שזה ג'יבריש?
                              בכל מקרה הנוסח "טקסט מקורי" הוא לא מדוייק - הטקסט המקורי זה מה שמוצג למשתמש, הוא התכוון לשכבת הטקסט הנסתרת.

                              ד
                              ד
                              דורש טוב
                              כתב ב נערך לאחרונה על ידי דורש טוב
                              #30

                              @יאיר-דניאל כתב:

                              מידיעה מהשערה או מזה שזה ג'יבריש?

                              פשוט מאד. גם בגלל הרזולוציה כמו ש@arieldaniely כתב
                              וגם שאם תנסה לערוך את הטקסט בPDF XChange למשל תראה שאפשר להזיז או למחוק אותו, בשונה מהש"ס של אוצריא שזה מטפל רק בשכבה השקופה
                              ועי' פה ובהודעות לפני ואחרי

                              תגובה 1 תגובה אחרונה
                              0
                              • י. פל.י
                                י. פל.י
                                י. פל.
                                כתב ב נערך לאחרונה על ידי
                                #31

                                מי רוצה לעבוד על זה?
                                https://github.com/Sivan22/pdf-missing-encoding-fixer-heb

                                ד יאיר דניאלי 2 תגובות תגובה אחרונה
                                0
                                • אהרןא
                                  אהרןא
                                  אהרן
                                  כתב ב נערך לאחרונה על ידי
                                  #32

                                  תוכל קצת לפרט מה זה?

                                  תגובה 1 תגובה אחרונה
                                  0
                                  • אהרןא
                                    אהרןא
                                    אהרן
                                    כתב ב נערך לאחרונה על ידי
                                    #33

                                    יש לך קובץ עם בעיה שאני יוכל לבדוק.

                                    תגובה 1 תגובה אחרונה
                                    0
                                    • י. פל.י
                                      י. פל.י
                                      י. פל.
                                      כתב ב נערך לאחרונה על ידי
                                      #34

                                      @אהרן
                                      תקרא כמה הודעות קודם, בבקשה.

                                      תגובה 1 תגובה אחרונה
                                      0
                                      • אהרןא
                                        אהרןא
                                        אהרן
                                        כתב ב נערך לאחרונה על ידי
                                        #35

                                        אני לא יודע איך לבדוק את זה, אצלי הPDF בכלל לא עולה, זה נתקע.

                                        תגובה 1 תגובה אחרונה
                                        0
                                        • י. פל.י י. פל.

                                          מי רוצה לעבוד על זה?
                                          https://github.com/Sivan22/pdf-missing-encoding-fixer-heb

                                          ד
                                          ד
                                          דורש טוב
                                          כתב ב נערך לאחרונה על ידי
                                          #36

                                          @י.-פל. לא מספיק טוב
                                          את הרש"י והתוספות הוא תיקן מעולה
                                          אבל הגמ' יצאה באותיות עבריות אמנם אבל בלי פשר
                                          אגב זה גם תלוי איך פותחים את הקובץ, בדפדפן ההעתקה לא טובה גם ברש"י ותוס', זה יוצא בלי רווחים ועוד שיבושים
                                          פתחתי בPDF XChange ושם יצא טוב, חוץ מהגמ'.
                                          לא בדקתי את שאר המפרשים על הדף
                                          מצורף דוגמא
                                          ברכות - וגשל.fixed.pdf

                                          תגובה 1 תגובה אחרונה
                                          0
                                          • י. פל.י י. פל.

                                            מי רוצה לעבוד על זה?
                                            https://github.com/Sivan22/pdf-missing-encoding-fixer-heb

                                            יאיר דניאלי
                                            יאיר דניאלי
                                            יאיר דניאל
                                            תורם לאוצריא ניהול תוספים
                                            כתב ב נערך לאחרונה על ידי
                                            #37

                                            @י.-פל. כתב:

                                            מי רוצה לעבוד על זה?
                                            https://github.com/Sivan22/pdf-missing-encoding-fixer-heb

                                            אני יוכל לעבוד על זה גם במחשב חלש, נכון?
                                            זה קורה בגיטאב, אם הבנתי נכון?
                                            כי לא באמת הבנתי איך אני משתמש בזה...

                                            ד תגובה 1 תגובה אחרונה
                                            0

                                            שלום! נראה שהשיחה הזו מעניינת אותך, אבל עדיין אין לך חשבון.

                                            נמאס לכם לגלול בין אותם הפוסטים בכל ביקור? כשנרשמים לחשבון, תמיד תחזרו בדיוק למקום שבו הייתם קודם, ותוכלו לבחור לקבל התראות על תגובות חדשות (בין אם במייל, ובין אם בהתראת פוש). תוכלו גם לשמור סימניות ולפרגן ב-upvote לפוסטים כדי להביע הערכה לחברי קהילה אחרים.

                                            בעזרת התרומה שלך, הפוסט הזה יכול להיות אפילו טוב יותר 💗

                                            הרשמה התחברות

                                            • התחברות

                                            • אין לך חשבון עדיין? הרשמה

                                            • התחברו או הירשמו כדי לחפש.
                                            • פוסט ראשון
                                              פוסט אחרון