דילוג לתוכן
0
  • דף הבית
  • חוקי הפורום
  • מדריכים
  • פוסטים אחרונים
  • לא נפתר
  • תגיות
  • פופולרי
  • משתמשים
  • תרומות לאוצריא
  • צור קשר
  • דף הבית
  • חוקי הפורום
  • מדריכים
  • פוסטים אחרונים
  • לא נפתר
  • תגיות
  • פופולרי
  • משתמשים
  • תרומות לאוצריא
  • צור קשר
עיצובים
  • בהיר
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • כהה
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • ברירת מחדל (ללא עיצוב (ברירת מחדל))
  • ללא עיצוב (ברירת מחדל)
כיווץ
לוגו אתר

פורום אוצריא

אוצריא - דף הבית
|
קח שותפות בהוספת ספרים
|
תרום לאוצריא
  1. דף הבית
  2. אתר העריכה 'ספריית אוצריא'
  3. הצעת ייעול | הגהה של ספרים באתר

הצעת ייעול | הגהה של ספרים באתר

מתוזמן נעוץ נעול הועבר אתר העריכה 'ספריית אוצריא'
הצעה לפיתוחספריית אוצריאocrעריכת ספרים
24 פוסטים 9 כותבים 1.1k צפיות 8 עוקבים
  • מהישן לחדש
  • מהחדש לישן
  • הכי הרבה הצבעות
    תגובה
    • תגובה כנושא
    התחברו כדי לפרסם תגובה
    נושא זה נמחק. רק משתמשים עם הרשאות מתאימות יוכלו לצפות בו.
    • 111 11

      @דוד-משה-1 כתב בהצעת ייעול | הגהה של ספרים באתר:

      אני אם הייתי מעלה לבינה זה אחרי OCR כלומר לעשות OCR ולהעלות לו תמונה ואת התוצאה

      הידע של ג'מיני לבצע OCR הוא עצום ביחס לתוכנות הישנות. כי הוא מזהה לכלולכים בדף וצורת הדף ולא רק מבנה אותיות.
      אחר כך הוא מזהה מבנה של אותיות.
      ורק בשלב השלישי הוא מתקן לפי דעתו הקלושה. אם תגדיר שהוא יעבוד לפי הסדר הזה בדיוק, תקבל תוצאות מקסימליות (ל-2026. בעוד שנה יהיה כבר יותר טוב)

      דוד משה 1ד
      דוד משה 1ד
      דוד משה 1
      מפתח
      כתב ב נערך לאחרונה על ידי
      #9

      @11 כתב בהצעת ייעול | הגהה של ספרים באתר:

      הידע של ג'מיני לבצע OCR הוא עצום ביחס לתוכנות הישנות. כי הוא מזהה לכלולכים בדף וצורת הדף ולא רק מבנה אותיות.
      אחר כך הוא מזהה מבנה של אותיות.

      הוא לא מבצע OCR הוא מנסה לקרוא את הטקסט בדיוק כמוך רק הוא קצת פחות מנוסה ממך בספרים בארמית מה שאני ממליץ זה לעשות לו עבודה קלה ולתת לו הוראות שיתקן איפה שצריך תיקון לדעתי זה אמור לחסוך בטוקנים והרבה מאוד בצורך בתיקונים

      תגובה 1 תגובה אחרונה
      0
      • י. פל.י
        י. פל.י
        י. פל.
        כתב ב נערך לאחרונה על ידי
        #10

        זה הולך להיות מהפכה לגמרי... @ע-ה-דכו-ע מצא API של גוגל לזיהוי הטקסט בדף, לפי ציר XY, והתכנון הוא לשלב: זיהוי לפי ציר, ואז ביצוע OCR עם פרומפט מורכב, כולל דוגמאות, ולדעתי הקלושה, סיכוי של זיהוי 99%+ בכתב נורמלי, ולפחות 90% בכתב בעייתי (אם הAPI יצליח בו... זו שאלה טובה).

        איש גמזוא תגובה 1 תגובה אחרונה
        2
        • י. פל.י י. פל.

          זה הולך להיות מהפכה לגמרי... @ע-ה-דכו-ע מצא API של גוגל לזיהוי הטקסט בדף, לפי ציר XY, והתכנון הוא לשלב: זיהוי לפי ציר, ואז ביצוע OCR עם פרומפט מורכב, כולל דוגמאות, ולדעתי הקלושה, סיכוי של זיהוי 99%+ בכתב נורמלי, ולפחות 90% בכתב בעייתי (אם הAPI יצליח בו... זו שאלה טובה).

          איש גמזוא
          איש גמזוא
          איש גמזו
          כתב ב נערך לאחרונה על ידי
          #11

          @י.-פל. גם בכתב רבנו שלמה יצחקי?

          תגובה 1 תגובה אחרונה
          0
          • י. פל.י
            י. פל.י
            י. פל.
            כתב ב נערך לאחרונה על ידי
            #12

            נראה כשיהיה מוכן. השערות הן השערות - כלום לא מעבר.

            איש גמזוא תגובה 1 תגובה אחרונה
            0
            • י. פל.י י. פל.

              נראה כשיהיה מוכן. השערות הן השערות - כלום לא מעבר.

              איש גמזוא
              איש גמזוא
              איש גמזו
              כתב ב נערך לאחרונה על ידי
              #13

              @י.-פל. מה הכוונה ציר XY? שורה?

              תגובה 1 תגובה אחרונה
              0
              • י. פל.י
                י. פל.י
                י. פל.
                כתב ב נערך לאחרונה על ידי
                #14

                GPT:
                בקיצור:
                ציר X-Y כאן מתייחס למיקום של הטקסט בדף לפי קואורדינטות —
                X מציין מיקום אופקי, Y מיקום אנכי.
                כך אפשר לדעת איפה כל מילה נמצאת בדף, ולא רק מה כתוב, ולשלב זאת עם OCR לזיהוי מדויק יותר.

                יאיר דניאלי תגובה 1 תגובה אחרונה
                0
                • 111
                  111
                  11
                  כתב ב נערך לאחרונה על ידי
                  #15

                  יש בזה הבדל מאוד מהותי אם אתה מעוניין בPDF עם תוצאה או שאתה מעוניין בטקסט. כי אם אתה מעוניין בחיפוש סטייל אוצר החכמה שתמצא בתוך הPDF אפשר במקביל להריץ כמה וכמה סריקות OCR, מכמה ספריות קיימות שעושות את זה בצורות שונות זו מזו.
                  ואמנם PDF בנוי לשכת טקסט אחת, אבל אפשר במקביל להריץ חיפוש תמיד בקובץ טקסט שיזהה את המיקום (בניתי מעין כלי כזה בעבר כך שאני יודע שזה אפשרי, וחבל על דאבדין). יש כמה ספריות חינמיות של OCR, ולענ"ד אין צורך בכלל להשתמש מעבר לזה, כי פענוח מקביל של 3-4 ספריות, יתן תוצאות ברמה מאוד גבוהה.
                  מצד שני, אם רוצים לייצר טקסט מבלי לצפות בדף החיפוש, אין ברירה אלא לבחור טקסט אחד, ואז נתקלים במחסום.

                  תגובה 1 תגובה אחרונה
                  1
                  • י. פל.י י. פל.

                    GPT:
                    בקיצור:
                    ציר X-Y כאן מתייחס למיקום של הטקסט בדף לפי קואורדינטות —
                    X מציין מיקום אופקי, Y מיקום אנכי.
                    כך אפשר לדעת איפה כל מילה נמצאת בדף, ולא רק מה כתוב, ולשלב זאת עם OCR לזיהוי מדויק יותר.

                    יאיר דניאלי
                    יאיר דניאלי
                    יאיר דניאל
                    תורם לאוצריא ניהול תוספים
                    כתב ב נערך לאחרונה על ידי יאיר דניאל
                    #16

                    @י.-פל. כתב בהצעת ייעול | הגהה של ספרים באתר:

                    GPT:
                    בקיצור:
                    ציר X-Y כאן מתייחס למיקום של הטקסט בדף לפי קואורדינטות —
                    X מציין מיקום אופקי, Y מיקום אנכי.
                    כך אפשר לדעת איפה כל מילה נמצאת בדף, ולא רק מה כתוב, ולשלב זאת עם OCR לזיהוי מדויק יותר.

                    זה מזכיר לי איזה נושא במתמחים שמישהו שם עבד על תוכנה שעשה OCR גם מכתבי יד של אנשים, האם זה קשור?

                    י. פל.י תגובה 1 תגובה אחרונה
                    0
                    • יאיר דניאלי יאיר דניאל

                      @י.-פל. כתב בהצעת ייעול | הגהה של ספרים באתר:

                      GPT:
                      בקיצור:
                      ציר X-Y כאן מתייחס למיקום של הטקסט בדף לפי קואורדינטות —
                      X מציין מיקום אופקי, Y מיקום אנכי.
                      כך אפשר לדעת איפה כל מילה נמצאת בדף, ולא רק מה כתוב, ולשלב זאת עם OCR לזיהוי מדויק יותר.

                      זה מזכיר לי איזה נושא במתמחים שמישהו שם עבד על תוכנה שעשה OCR גם מכתבי יד של אנשים, האם זה קשור?

                      י. פל.י
                      י. פל.י
                      י. פל.
                      כתב ב נערך לאחרונה על ידי י. פל.
                      #17

                      @יאיר-דניאל
                      לא קשור בכלל.

                      יאיר דניאלי תגובה 1 תגובה אחרונה
                      0
                      • י. פל.י י. פל.

                        @יאיר-דניאל
                        לא קשור בכלל.

                        יאיר דניאלי
                        יאיר דניאלי
                        יאיר דניאל
                        תורם לאוצריא ניהול תוספים
                        כתב ב נערך לאחרונה על ידי
                        #18
                        פוסט זה נמחק!
                        תגובה 1 תגובה אחרונה
                        0
                        • י. פל.י
                          י. פל.י
                          י. פל.
                          כתב ב נערך לאחרונה על ידי
                          #19

                          עניתי, ובא נפסיק את ההסטה של הנושא.

                          תגובה 1 תגובה אחרונה
                          0
                          • 111
                            111
                            11
                            כתב ב נערך לאחרונה על ידי
                            #20

                            שוחחתי הבוקר בארוכה עם המומחה שלי לענייני סטטיסטיקה ותוכן.
                            מה שיצא לנו זה זה רעיון בערך כזה (מקווה לנסות ליישם בקרוב):

                            1. לקחת מאגר ספרים גדול מאוד של סריקות, כמו לדוגמה היברובוקס, ולהריץ מודל ocr, אבל להכניס ממנו רק את התוצאות שמוגדרות בסריקה כרמת וודאות של 95 אחוז ומעלה (רוב כלי הOCR גם כותבים רמת וודאות).
                            2. המילים הנ"ל נכנסות למאגר מילוני, וכעת התוכנה מחפשת מילים שאינן במילון שיכולות להכנס בעזרת החלפת אות אחת (אולי עדיף בשלב ראשון רק החלפת אותיות דומות בעברית, כמו ה' וח' או ב' וכ').
                            3. המילון מחליף את התמונה, ובו זמנית מזהה שמהיום תמונה של בראשיח היא בעצם בראשית, וזה נכנס לרמת וודאות גבוהה ונוסף למילון כבראשית.
                            4. בכל הרצה נוספים מילים נוספות למילון, בשעה שמילה שאינה קיימת בעברית/לשה"ק לא תוכל להכנס אלא אם היא ברמת וודאות של 100 אחוז.
                            5. הרצה נוספת שצריך לשקול באיזה שלב, לקחת קורפוס כזה או אחר (יש כמה חינמיים), ולהוסיף למילון לאחר שמיצינו את הבעיות. (בו זמנית כל קורפוס מכיל סטטיסטיקות של סבירות תדירות אותיות, צריך לשקול שימוש בזה).
                            6. הרצה נוספת שצריך לשקול באיזה שלב, חיפוש רצף מילים, נניח 10 מילים זהות שנמצאות במקום אחר בשינוי אות אחת, שיבנה לפי סטטיסטיקות. אחר כך יורד ל9 וכן הלאה.

                            כל זה נשמע מסובך מאוד, כי זה מסובך מאוד, אבל כבר אמר הגר"א שהעקשן יצליח, ואני מתכוון בעז"ה להתעקש.
                            הבעיה הגדולה כאן היא שכל טעות בתכנון עלולה לעלות ביוקר רב. ולכן אשמח לכל משוב ותוספת רעיונות וכו'.

                            דאנציגד תגובה 1 תגובה אחרונה
                            7
                            • 111 11

                              שוחחתי הבוקר בארוכה עם המומחה שלי לענייני סטטיסטיקה ותוכן.
                              מה שיצא לנו זה זה רעיון בערך כזה (מקווה לנסות ליישם בקרוב):

                              1. לקחת מאגר ספרים גדול מאוד של סריקות, כמו לדוגמה היברובוקס, ולהריץ מודל ocr, אבל להכניס ממנו רק את התוצאות שמוגדרות בסריקה כרמת וודאות של 95 אחוז ומעלה (רוב כלי הOCR גם כותבים רמת וודאות).
                              2. המילים הנ"ל נכנסות למאגר מילוני, וכעת התוכנה מחפשת מילים שאינן במילון שיכולות להכנס בעזרת החלפת אות אחת (אולי עדיף בשלב ראשון רק החלפת אותיות דומות בעברית, כמו ה' וח' או ב' וכ').
                              3. המילון מחליף את התמונה, ובו זמנית מזהה שמהיום תמונה של בראשיח היא בעצם בראשית, וזה נכנס לרמת וודאות גבוהה ונוסף למילון כבראשית.
                              4. בכל הרצה נוספים מילים נוספות למילון, בשעה שמילה שאינה קיימת בעברית/לשה"ק לא תוכל להכנס אלא אם היא ברמת וודאות של 100 אחוז.
                              5. הרצה נוספת שצריך לשקול באיזה שלב, לקחת קורפוס כזה או אחר (יש כמה חינמיים), ולהוסיף למילון לאחר שמיצינו את הבעיות. (בו זמנית כל קורפוס מכיל סטטיסטיקות של סבירות תדירות אותיות, צריך לשקול שימוש בזה).
                              6. הרצה נוספת שצריך לשקול באיזה שלב, חיפוש רצף מילים, נניח 10 מילים זהות שנמצאות במקום אחר בשינוי אות אחת, שיבנה לפי סטטיסטיקות. אחר כך יורד ל9 וכן הלאה.

                              כל זה נשמע מסובך מאוד, כי זה מסובך מאוד, אבל כבר אמר הגר"א שהעקשן יצליח, ואני מתכוון בעז"ה להתעקש.
                              הבעיה הגדולה כאן היא שכל טעות בתכנון עלולה לעלות ביוקר רב. ולכן אשמח לכל משוב ותוספת רעיונות וכו'.

                              דאנציגד
                              דאנציגד
                              דאנציג
                              תורם לאוצריא
                              כתב ב נערך לאחרונה על ידי
                              #21

                              @11

                              בתוכנה של יעקובוב: 1. הוא בנה מאגר בסיסי שמגיע עם התוכנה. 2. ו-3. מיושמים הלכה למעשה, כאשר 4. הוא על ידי המשתמש עצמו, ויכול לבחור פר ספר איזה מילון מילים, ולהוסיף זיהוי וודאי לאותיות ספציפיות הקיימות בספר זה בלבד - ליצור לכל ספר בפני עצמו מאגר מילים נפוצות, ומאגר OCR ייחודי, ולכן כל זמן שזה מודפס - תמונת מילים שחוזרת על עצמה באופן קבוע, רמת הדיוק של התוכנה שלו גבוהה.
                              הבעיה מתחילה כאשר יש לך אותיות שבורות חצויות וכדומה, שאז צריך לאמן את התוכנה מחדש על עשרות ווריאציות חדשות שלא קיימות בשום מאגר בעולם.
                              ולא, לא באתי לפרסם את התוכנה שלו, אלא מהתנסות איתה [שילמתי עליה טבין ותקילין, והגעתי למצב שבכתב רש"י ברור וחד, היו טעויות רק במילים חדשות].

                              תגובה 1 תגובה אחרונה
                              0
                              • 111
                                111
                                11
                                כתב ב נערך לאחרונה על ידי
                                #22

                                התברר שזה יותר מורכב ממה שחשבתי. (ומלכתחילה חשבתי שזה מורכב). אז בינתיים אני משקיע את זמני בעזרה אחרת לעם ישראל. אולי יום יבוא.

                                דאנציגד תגובה 1 תגובה אחרונה
                                0
                                • 111 11

                                  התברר שזה יותר מורכב ממה שחשבתי. (ומלכתחילה חשבתי שזה מורכב). אז בינתיים אני משקיע את זמני בעזרה אחרת לעם ישראל. אולי יום יבוא.

                                  דאנציגד
                                  דאנציגד
                                  דאנציג
                                  תורם לאוצריא
                                  כתב ב נערך לאחרונה על ידי
                                  #23

                                  @11 כתב בהצעת ייעול | הגהה של ספרים באתר:

                                  אולי יום יבוא.

                                  https://gitlab.com/pninim.org/tessdata_heb_rashi יכול לזרז את היום שכבר יבוא?

                                  111 תגובה 1 תגובה אחרונה
                                  0
                                  • דאנציגד דאנציג

                                    @11 כתב בהצעת ייעול | הגהה של ספרים באתר:

                                    אולי יום יבוא.

                                    https://gitlab.com/pninim.org/tessdata_heb_rashi יכול לזרז את היום שכבר יבוא?

                                    111
                                    111
                                    11
                                    כתב ב נערך לאחרונה על ידי
                                    #24

                                    @דאנציג כתב בהצעת ייעול | הגהה של ספרים באתר:

                                    @11 כתב בהצעת ייעול | הגהה של ספרים באתר:

                                    אולי יום יבוא.

                                    https://gitlab.com/pninim.org/tessdata_heb_rashi יכול לזרז את היום שכבר יבוא?

                                    לצערי לא.
                                    היצר הרע שלי נהג בעבר לפתות אותי לכלות את הזמן על כאלו דברים, עד ששמתי לו גבול והודעתי לו שאני לא מצטרף לשום קבוצת תכנות בגיטהאב, ויהי מה.
                                    דבר איתו.

                                    תגובה 1 תגובה אחרונה
                                    0

                                    שלום! נראה שהשיחה הזו מעניינת אותך, אבל עדיין אין לך חשבון.

                                    נמאס לכם לגלול בין אותם הפוסטים בכל ביקור? כשנרשמים לחשבון, תמיד תחזרו בדיוק למקום שבו הייתם קודם, ותוכלו לבחור לקבל התראות על תגובות חדשות (בין אם במייל, ובין אם בהתראת פוש). תוכלו גם לשמור סימניות ולפרגן ב-upvote לפוסטים כדי להביע הערכה לחברי קהילה אחרים.

                                    בעזרת התרומה שלך, הפוסט הזה יכול להיות אפילו טוב יותר 💗

                                    הרשמה התחברות

                                    • התחברות

                                    • אין לך חשבון עדיין? הרשמה

                                    • התחברו או הירשמו כדי לחפש.
                                    • פוסט ראשון
                                      פוסט אחרון