GPT
O

olmOCR-2-7B-1025-FP8

קוד פתוח

allenaiרישיון לא דווח2025-10-06

  • transformers
  • safetensors
  • qwen2_5_vl
  • image-text-to-text
  • conversational

פתרון ראייה ממוקד להמרת מסמכים סרוקים ומורכבים לטקסט נקי. הוא מגיע מכווץ ומאומן במיוחד על טבלאות ונוסחאות מתמטיות קשות.

  • 128,000טוקנים בהקשר
  • 9.4 GBמשקל הקבצים
  • 226,958הורדות בחודש
  • 255לייקים

מה זה

מדובר במודל ראייה שמבוסס על Qwen2.5-VL-7B-Instruct ועבר כיווץ לפורמט FP8 באמצעות llmcompressor. המטרה שלו היא לא לנהל שיחות כלליות על תמונות, אלא לקחת עמוד של מסמך, סריקה או מאמר, ולחלץ ממנו את התוכן בצורה מדויקת ומסודרת.

האימון כלל שלב ייעודי של למידת חיזוק בשיטת GRPO על מערך נתונים סינתטי כדי לחזק אותו במקומות שבהם מנועי קריאה רגילים נשברים. במבחני הביצועים של olmOCR-bench הוא שומר על ציון כולל של 82.4, כמעט זהה למקור הלא מכווץ, כשהוא מציג תוצאות חזקות במיוחד בזיהוי כותרות עליונות ותחתונות עם 96.1, פיענוח טבלאות עם 84.9, ונוסחאות מתמטיות בסריקות ישנות עם 82.3.

הייחוד כאן הוא השילוב בין מודל קומפקטי יחסית של שבעה מיליארד פרמטרים ליכולת לטפל במבנים מורכבים כמו עמודות מרובות או טקסט צפוף וקטן, תחומים שבהם מודלים כלליים בגודל הזה נוטים לאבד את סדר הקריאה הנכון.

מתאים ל

  • פיענוח מאמרים מדעיים

    הוא מותאם ספציפית לנוסחאות וטקסט רב עמודתי ומגיע לציון 83.0 במאמרי ArXiv.

  • חילוץ נתונים מטבלאות

    אימון החיזוק שלו שומר על מבנה תאים מדויק במסמכים פיננסיים וטכניים.

  • עיבוד עמודים מרובי טורים

    הוא עוקב אחרי סדר הקריאה הנכון בפריסות מורכבות ומפריד כותרות מהתוכן.

איפה זה נופל

החולשה הבולטת ביותר לפי המבחנים היא סריקות ישנות ופגומות, שם הציון צונח ל־47.7 בלבד. בנוסף, הוא דורש הכנה מוקדמת של הקלט, התמונה חייבת לעבור רינדור כך שהצלע הארוכה שלה תהיה בדיוק 1288 פיקסלים, והפרומפט צריך לכלול מטא־דאטה ספציפי מהמסמך כדי לתת תוצאה טובה.

אותה משפחה

olmOCR-2-7B-1025 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להעביר לו תמונה בכל רזולוציה?

לא ישירות. המודל מצפה לתמונה שרונדרה מראש כך שהממד הארוך ביותר שלה הוא 1288 פיקסלים, בצירוף מטא־דאטה שנחלץ מהעמוד.

האם גרסת ה־FP8 פוגעת באיכות התוצאות ביחס למקור?

הבדיקות מראות שהפגיעה כמעט לא קיימת. הציון הכולל ירד מ־82.3 בגרסה המלאה ל־82.4 בגרסה הזו, עם שיפור קל בחלק מהמבחנים.

איך מריצים

המשקל הכולל של הקבצים עומד על 9.4 גיגה בייט בגרסת FP8, מה שמאפשר להריץ אותו בנוחות על כרטיס מסך בודד עם זיכרון של 16 גיגה בייט ומעלה. הדרך המעשית ביותר לעבוד איתו היא דרך ערכת הכלים של olmOCR שכוללת תשתית מובנית להסקה מהירה באמצעות vLLM.

אם אתם צריכים לעבד רק כמה עשרות עמודים בודדים מדי פעם, עדיף להשתמש ב־API חיצוני של מודל ראייה גדול במקום להחזיק שרת ייעודי. ההרצה העצמית משתלמת רק אם יש לכם נפח עבודה רציף של אלפי מסמכים שצריך להמיר באופן מקומי.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="allenai/olmOCR-2-7B-1025-FP8")
print(pipe("שלום"))

הרישיון

בטקסט של כרטיס המודל נכתב שהוא תחת רישיון Apache 2.0 המאפשר שימוש מסחרי חופשי, אך בנתוני המערכת של הדף מופיע שלא דווח רישיון. במצב כזה מומלץ לבדוק את הקוד והמאגר הרשמי לפני שילוב שלו במוצר מסחרי כדי למנוע חשיפה משפטית.

הרישיון המלא בעמוד המודל ↗