פתיחת קבצי PDF, תמונה או טקסט באוצריא ישירות, ללא צורך להוסיף אותם לספרייה. לתמונות ולעמודי PDF סרוקים ללא שכבת טקסט - ניתן להריץ זיהוי טקסט (OCR) בעברית לפי דרישה.
🖱️ לחיצה ימנית על עמוד PDF/תמונה פתוח בתוסף מציגה קיצור "חלץ טקסט" - מנסה טקסט מוטבע קודם, ואם אין נופל אוטומטית ל-OCR.
📚 בנוסף, בכל הספרייה של אוצריא (בספרי טקסט) - לחיצה ימנית על הקורא מציגה גם היא פריט "חלץ טקסט".
📄 בספרי PDF בספרייה - כפתור ✂️ בסרגל הכלים של הקורא מנסה קודם טקסט שאוצריא כבר אינדקסה לספר (ומעתיק אותו ללוח אם נמצא) - ההודעה מופיעה ישירות בספרייה, בלי לצאת ממנה. אם לא נמצא טקסט מאונדקס (המצב הנפוץ לספרי PDF סרוקים, שכן לתוסף אין גישה לקובץ עצמו) - תופיע התראה שמציעה לגזור את האזור הרצוי עם כלי הגזירה של המערכת (Win+Shift+S בחלונות, Cmd+Shift+4 ב-Mac), עם אפשרות ללחוץ על ההתראה כדי לפתוח את התוסף. בתוך התוסף אפשר להדביק את הגזרה עם "✂️ הדבק גזרת מסך וחלץ" (או Ctrl+V), או לצלם ולבחור אזור בתוך התוסף עצמו עם "🖥️ צלם ובחר כאן" - בשני המקרים ינסה קודם טקסט מוטבע ואם אין יפעיל OCR אוטומטית.
💡 שיטת הגזירה עובדת עם כל תוכנה שמציגה PDF (לא רק אוצריא), ולא רק עבור ספרי PDF בספרייה - אפשר להשתמש בה בכל מצב שבו קשה לפתוח את הקובץ המקורי ישירות בתוסף.
נוצר באמצעות Claude ע"י חד בדרא
מנוע ה-OCR ושפת העברית כלולים בתוסף - זיהוי טקסט (OCR) מוכן לשימוש ללא צורך בהתקנה נוספת.
אם רוצים גישה למנוע ה-OCR המובנה של Windows בעתיד, זה ידרוש בקשת פיצ'ר לאוצריא עצמה (התוסף לא יכול לעשות את זה בכוחות עצמו) — שהיא תוסיף permission חדשה שקוראת ל-OCR הנייטיבי מצד ה-Dart/Flutter וחושפת אותה כ-API לתוספים. בינתיים Tesseract.js הוא האפשרות היחידה שזמינה לתוסף.
🛠️ בתכנון: שמירת קובץ PDF עם הטקסט שזוהה ב-OCR מוטבע בו כשכבת טקסט נסתרת (PDF ניתן לחיפוש), בדומה לתוכנות OCR מסחריות.
עברית מובנית בתוסף. אפשר להוסיף שפות נוספות (כמו אנגלית) בלי לבנות גרסה חדשה של התוסף:
.traineddata) מהמאגר הרשמי של Tesseract, למשל עבור אנגלית:https://github.com/tesseract-ocr/tessdata_fast/raw/main/eng.traineddataeng בקוד כל שפה אחרת מאותו מאגר)דברים שהתוסף לא יכול לפתור בכוחות עצמו - דורשים שינוי באוצריא עצמה. אפשר לפתוח עליהם Issue ב-github.com/Otzaria/otzaria:
1. תמיכה בפריטי תוסף בתפריט הקשר במסך PDF
לפי DESIGN_GUIDE.md: "תפריט ההקשר מוצג במסכי טקסט בלבד (CombinedView ו-PageShape). מסך PDF אינו תומך בפריטי תוסף בתפריט ההקשר כרגע." אומת בפועל - פריט מהתוסף (למשל "חלץ טקסט") נרשם ועובד בספרי טקסט, אך לא מופיע בכלל בלחיצה ימנית על ספרי PDF בספרייה. מגרסה 2.1.0 יש עקיפה חלקית - כפתור בסרגל הכלים (`reader.addToolbarItem`) כן נתמך במסך PDF - אבל עדיין כדאי לבקש תמיכה מלאה גם בתפריט ההקשר, לעקביות עם ספרי טקסט.
2. גישה למנוע ה-OCR המובנה של Windows
תוספים רצים בדף מבודד ללא גישה ל-API נייטיביים, ולכן חייבים להטמיע מנוע OCR מבוסס-WASM (Tesseract.js) בתוך התוסף עצמו - כבד ופחות מדויק ממנוע נייטיבי. בקשה: הוספת permission ו-API (למשל ocr.recognizeImage) שמפעיל את מנוע ה-OCR המובנה של המערכת (Windows.Media.Ocr בחלונות) מצד ה-Dart/Flutter של אוצריא, ומחזיר את הטקסט המזוהה לתוסף.
3. גישה לקובץ/לתמונת עמוד של ספרי PDF בספרייה
אין כיום API שחושף לתוסף את בייטים של קובץ ה-PDF או תמונת עמוד עבור ספר PDF שמנוהל בספריית אוצריא (בשונה מ-fs.pickUserFile, שעובד רק על קובץ שהמשתמש בוחר ידנית). זה מכוון: גם library.resolveBooks מציינת מפורש "בלי לחשוף נתיבים". לכן, "חלץ טקסט" על ספר כזה יכול להחזיר רק טקסט שאוצריא כבר אינדקסה בעצמה - לא לקרוא את שכבת הטקסט המוטבעת בקובץ בזמן אמת, ובוודאי לא להריץ עליו OCR. מגרסה 2.3.0 יש עקיפה נוחה (גזירת מסך + הדבקה בתוסף - ראו למעלה) שהופכת את זה לפחות דחוף, אך עדיין כדאי לבקש API רשמי כמו reader.getPdfPageImage (או חשיפת נתיב/בייטים מוגבלת-הרשאה, בהסכמת המשתמש) לחוויה חלקה יותר בלי צורך בגזירה ידנית.
🐞 מגבלות ידועות ולא-באגים: קובץ TIFF מרובה-עמודים מציג רק את העמוד הראשון (מוצג בסטטוס בזמן פתיחה). גודל התוסף (כ-4.4MB) נובע ממנוע ה-OCR (Tesseract.js) המובנה בו לתמיכה מלאה במצב offline.
מצב מנוע ה-OCR: