בדקתי את הקובץ שהעלית. הנה מה שרלוונטי לאוצריא:
מה שאפשר כבר עכשיו: קובצי PDF נכנסים לאוצריא כספרים אישיים — הגדרות ← ספרייה ← "הוסף תיקייה לאוצריא". הם ייפתחו בקורא ה-PDF המובנה, עם תוכן עניינים (אם יש outline בקובץ), סימניות והדפסה.
הבעיה שתתקלו בה — חיפוש. הקובץ הזה אינו סריקה: הוא קובץ דפוס וקטורי (644 עמודים) ויש בו שכבת טקסט אמיתית. אבל הגופנים הם גופני DTP ישנים (FrankRuehl, Rashi, Guttman וכד') בקידוד קדם-יוניקוד — טבלאות ה-ToUnicode שבקובץ ממפות את האותיות לתווים לטיניים (É, Ò, Ù וכו'), לא לאותיות עבריות. כלומר חילוץ טקסט מהקובץ מחזיר ג'יבריש, וממילא החיפוש הפנימי באוצריא לא ימצא בו כלום.
הפתרון הנתמך באוצריא לזה — קובץ טקסט נלווה (sidecar). אוצריא מחפש ליד קובץ ה-PDF קובץ בשם שם-הקובץ.pdf.txt (או אותו שם עם סיומת .txt), ואם הוא קיים — מאנדקס אותו במקום שכבת הטקסט הפגומה. העמודים בקובץ מופרדים בתו form feed (\f), עמוד כנגד עמוד. התוצאה: חיפוש מלא בספר וקפיצה לעמוד הנכון. (הסימון הצהוב בתוך העמוד עצמו לא יעבוד במצב הזה — רק ניווט לעמוד.)
אומת בקוד של 0.9.97+789 (_loadPdfSidecar ב-lib/indexing/repository/indexing_repository.dart).
נקודה לטובתכם: מכיוון שיש שכבת טקסט ולא סריקה בלבד, הפקת קובצי ה-txt לא מחייבת OCR — מדובר בהמרת קידוד, שהיא מדויקת הרבה יותר מזיהוי תווים מתמונה.