GPT
O

olmOCR-2-7B-1025

קוד פתוח

allenaiapache-2.02025-10-06

  • transformers
  • safetensors
  • qwen2_5_vl
  • image-text-to-text
  • conversational

המודל מחלץ טקסט מתמונות ומסמכים סרוקים מורכבים כמו טבלאות ומשוואות. הוא מתאים למי שרוצה OCR מדויק בהרצה עצמית בלי להסתמך על מודלי ענק סגורים.

  • 8.3Bפרמטרים
  • 128,000טוקנים בהקשר
  • 15.5 GBמשקל הקבצים
  • 199,792הורדות בחודש

מה זה

מדובר בהתאמה של Qwen2.5-VL-7B שפותחה על ידי מכון אלן לבינה מלאכותית ומיועדת להמרת עמודי מסמכים לטקסט. המפתחים אימנו אותו על מאגר ייעודי והוסיפו אימון חיזוק עם GRPO, במטרה להתמודד עם אתגרים ששוברים מנועי זיהוי רגילים: נוסחאות מתמטיות, פריסות מרובות עמודות וטבלאות צפופות.

במבחני הביצועים של olmOCR-bench המודל מגיע לציון כולל של 82.3. הוא מפגין דיוק גבוה מאוד בזיהוי כותרות עליונות ותחתונות עם 95.7, ומתמודד יפה עם מאמרים אקדמיים ומבנים מרובי עמודות סביב 83 עד 84 נקודות. עם זאת, הוא מתקשה באופן מורגש מול סריקות ישנות, שם הציון צונח ל־48.3 בלבד.

מתאים ל

  • המרת מאמרים אקדמיים

    הוא מצטיין בזיהוי נוסחאות מתמטיות מורכבות ומבנה של שני טורים בדיוק של מעל 82 אחוזים.

  • חילוץ נתונים מטבלאות

    אימון החיזוק שלו הותאם ספציפית לשמירה על שלמות טבלאות וטקסט צפוף בעמודים סרוקים.

  • אימון המשך על דאטה ייעודי

    גרסת ה־BF16 הזו שומרת על המשקלים המלאים, מה שהופך אותה לבסיס הנכון לכוונון עדין נוסף.

איפה זה נופל

הנקודה החלשה ביותר היא סריקות היסטוריות או מסמכים ישנים באיכות ירודה, שם המודל מקבל ציון נמוך של 48.3 ונוטה לפספס. בנוסף, המודל אומן והוגדר עבור השפה האנגלית בלבד, כך שלא כדאי לבנות עליו לעיבוד מסמכים בעברית. הוא גם דורש מעטפת קוד ייעודית לחיתוך והכנת התמונה לפני השליחה, ולא מתפקד כמנוע שזורקים אליו PDF גולמי ומקבלים פלט.

אותה משפחה

olmOCR-2-7B-1025 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך במסמכים בעברית?

לא. המודל הוגדר ואומן עבור השפה האנגלית בלבד. אם יש לכם מסמכים בעברית, הוא כנראה ייצר שגיאות גסות ולא יזהה את הטקסט נכון.

למה להוריד את הגרסה הזו ולא את גרסת ה־FP8?

לפי הצוות שפיתח את המודל, אין סיבה מעשית לעשות זאת אלא אם אתם מתכוונים לאמן אותו הלאה. גרסת ה־FP8 מציגה ביצועים זהים במבחנים ותדרוש מכם משמעותית פחות זיכרון גרפי בזמן ריצה.

איך מריצים

כדי להריץ את גרסת ה־BF16 המלאה תצטרכו כרטיס מסך מודרני עם לפחות 24 גיגה-בייט של זיכרון גרפי, שכן משקל הקבצים לבדו עומד על 15.5 גיגה-בייט. המפתחים עצמם מציינים במפורש שעדיף להשתמש בגרסת ה־FP8 לכל צורך מעשי בייצור, אלא אם אתם מתכננים להמשיך ולאמן את המודל בעצמכם.

הדרך הפשוטה להריץ אותו היא דרך כלי ה־CLI והספרייה שהם שחררו, שעושה שימוש ב־vLLM לעיבוד מקבילי בקנה מידה רחב. המודל דורש הכנת קלט ספציפית: העמוד חייב לעבור רינדור כך שהצלע הארוכה תהיה בדיוק 1288 פיקסלים, לצד מטא-דאטה שהכלי מחלץ מראש.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="allenai/olmOCR-2-7B-1025")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי של הקוד והמשקלים והפצה חופשית, כל עוד שומרים על הודעת זכויות היוצרים המקורית. אפשר לשלב אותו במוצרים פנימיים או מסחריים בלי לחשוף את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗