GPT
O

olmOCR-7B-0225-preview

קוד פתוח

allenaiapache-2.02025-01-15

  • transformers
  • safetensors
  • qwen2_vl
  • image-text-to-text
  • conversational

מדובר במודל ראייה ושפה שתוכנן לחלץ טקסט מעמודי מסמכים וקבצי PDF. הוא מבוסס על כוונון ממוקד שנועד להתמודד עם פריסות עמוד מורכבות במקום לסמוך על OCR פשוט.

  • 8.3Bפרמטרים
  • 32,768טוקנים בהקשר
  • 15.5 GBמשקל הקבצים
  • 11,313הורדות בחודש

מה זה

אלן AI לקחו את Qwen2-VL-7B ואימנו אותו מחדש על דאטה-סט ייעודי בשם olmOCR-mix-0225 כדי לפתור בעיה ספציפית: המרת מסמכים סרוקים, דוחות ומאמרים לטקסט נקי. במקום לנסות להיות מודל שיחה כללי שסתם יודע לזהות תמונות, הדגם הזה מתמקד בהבנת המבנה הפנימי של הדף, כולל בלוקים של טקסט ומטא-דאטה שנלווים אליהם.

המודל דורש שתמירו את עמוד המסמך לתמונה שבה הצלע הארוכה ביותר היא בדיוק 1024 פיקסלים, ומצפה לפרומפט שמכיל מטא-דאטה מובנה על מבנה הדף. הוא לא מקבל סתם תמונה גולמית של דף ומנחש לבד מה קורה שם, אלא נשען על קדם-עיבוד שמחלץ מידע בסיסי כדי לדייק את הפלט. המפתחים בנו סביבו ארגז כלים שלם שדואג להכנת הנתונים הזו ולהרצה מהירה בקנה מידה רחב.

מי שמתעסק עם קריאת מסמכים באנגלית ימצא כאן כלי ממוקד יותר ממודלי ראייה כלליים. עם זאת, הוא לא מיועד להחליף מנועי OCR מסורתיים עבור משימות פשוטות של שורה אחת, אלא מכוון לעיבוד עמוק של דפים שלמים שדורשים שמירה על הקשר וסדר קריאה נכון.

מתאים ל

  • המרת מאמרים אקדמיים לטקסט

    הוא יודע להתמודד עם טורים מרובים ומבנה מורכב של עמודים באנגלית טוב יותר מ־OCR רגיל.

  • דיגיטציה של דוחות באנגלית

    התשתית עם sglang מתאימה לטחינה של כמויות ענק של מסמכים סרוקים בתוך ארגון.

  • בניית מאגרי מידע ל־RAG

    הוא מחלץ טקסט תוך שמירה על ההקשר של הדף, מה שמקל על חלוקה מדויקת למקטעים.

איפה זה נופל

החולשה המרכזית עבור משתמשים בארץ היא השפה. המודל מוגדר ומאומן עבור אנגלית בלבד, כך שאין מה לבנות עליו לחילוץ טקסט בעברית. בנוסף, זוהי גרסת preview, כלומר היא עדיין לא מוצר סופי ויכולה לסבול מאי-דיוקים. המודל גם תלוי לחלוטין בהכנה מקדימה של התמונה לגודל 1024 פיקסלים ובחילוץ מטא-דאטה, כך שאי אפשר פשוט לזרוק עליו קובץ PDF גולמי ולצפות לתוצאה טובה בלי להריץ את כלי העזר שמסביבו.

שאלות
נפוצות

האם אפשר להשתמש בו לקריאת מסמכים בעברית?

המודל מאומן ומוגדר רשמית עבור אנגלית בלבד. אם תנסו להריץ עליו מסמכים בעברית תקבלו ג'יבריש או הזיות, ולכן למסמכים מקומיים תצטרכו לחפש פתרון אחר שתומך בשפות מרובות.

למה צריך את ארגז הכלים של המפתחים ולא פשוט להשתמש ב־transformers?

המודל מצפה לקבל תמונה בגודל מסוים יחד עם מטא-דאטה שמופק מתוך ה־PDF המקורי. ארגז הכלים שלהם מייצר את הפרומפט המדויק ומטפל ברינדור של הדפים, ובלעדיו תצטרכו לכתוב את כל שכבת ההכנה הזו בעצמכם.

איך מריצים

בשביל להריץ 8.3 מיליארד פרמטרים בפורמט bfloat16 תצטרכו כרטיס מסך עם לפחות 24 גיגה-בייט של VRAM, כמו RTX 3090 או A10, כדי לטעון את 15.5 הגיגה של המשקלים ולהשאיר מקום לחלון ההקשר. המפתחים ממליצים להשתמש בספריית sglang יחד עם ארגז הכלים שלהם, מה שמאפשר לייצר תשתית עיבוד שמסוגלת לבלוע כמויות גדולות של מסמכים בצורה מקבילית.

אם יש לכם רק כמה עשרות דפים פה ושם, כנראה שעדיף להשתמש ב־API קיים ולא להרים שרת ייעודי שתופס חומרה יקרה. הרצה עצמית של המודל הזה משתלמת בעיקר אם יש לכם מאגר של אלפי עמודים שאתם רוצים להמיר אופליין בלי לשלם על כל קריאה ובלי להוציא את המידע מהרשת הפנימית.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="allenai/olmOCR-7B-0225-preview")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה מחדש בלי תמלוגים, כל עוד שומרים על הודעות זכויות היוצרים המקוריות. למרות שהמפתחים מציינים שהגרסה מיועדת למחקר ולחינוך ומפנים להנחיות שימוש אחראי, הרישיון המשפטי עצמו אינו מגביל הטמעה במוצרים מסחריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗