GPT
R

RolmOCR

קוד פתוח

reductoapache-2.02025-04-02

  • transformers
  • safetensors
  • qwen2_5_vl
  • image-text-to-text
  • conversational

פתרון ראיית מחשב לקריאת מסמכים שחוסך משאבים ומספק חלופה מהירה לפרויקט של מכון אלן. הוא קורא קבצים מורכבים ישירות מהתמונה בלי להסתמך על מטא דאטה.

  • 8.3Bפרמטרים
  • 128,000טוקנים בהקשר
  • 15.5 GBמשקל הקבצים
  • 32,924הורדות בחודש

מה זה

מדובר בהתאמה ייעודית של מודל הבסיס Qwen2.5-VL בגרסת שבעה מיליארד פרמטרים, שאומן על מערך הנתונים של olmOCR. המטרה כאן היא לקחת מסמכים, טפסים וסריקות ולהוציא מהם טקסט נקי, אבל עם שינוי ארכיטקטוני מכוון. היוצרים ויתרו לחלוטין על הזנת מטא דאטה של קובצי PDF לפרומפט, מה שמקצר את הקלט וחוסך זיכרון עבודה.

האימון כלל גם הטיה של כחמישה עשר אחוזים מהמסמכים כדי שהראייה תישאר יציבה כשהדף סרוק עקום. ההבדל המרכזי מול הגישה המקורית של מכון אלן הוא פחות עומס על הכרטיס ומהירות תגובה גבוהה יותר, בלי לשלם בדיוק ברוב סוגי המסמכים הרגילים.

מתאים ל

  • חילוץ טקסט מסריקות עקומות

    האימון כלל דפים מוטים במכוון, ולכן הוא מתמודד טוב יותר עם דפים שנכנסו עקום לסורק.

  • עיבוד מסמכים ארוכים בזיכרון נמוך

    הוויתור על מטא דאטה בפרומפט מקטין את כמות הטוקנים ומאפשר לרוץ על כרטיסי מסך סטנדרטיים.

  • המרה של קובצי PDF לטקסט נקי

    הוא נבנה כחלופה ישירה וקלה לתפעול של olmOCR עבור צנרות עיבוד מסמכים קיימות.

איפה זה נופל

כמו כל מודל ויזואלי מהסוג הזה, הוא עלול להמציא טקסט או לדלג על שורות שלמות בלי שום התראה. חיסרון משמעותי נוסף הוא חוסר היכולת להחזיר תיבות תוחמות של האלמנטים בדף, כך שמי שחייב לדעת איפה בדיוק יושבת כל פסקה ייתקל בבעיה. בנוסף, המפתחים מודים שהם לא בדקו איך המודל מתנהג תחת קוונטיזציה, כך שדחיסה שלו עלולה לפגוע בתוצאות.

שאלות
נפוצות

האם המודל מחזיר מיקום של טבלאות ופסקאות בעמוד?

לא. בניגוד לממשקים מסחריים ייעודיים, הוא לא פולט תיבות תוחמות אלא טקסט בלבד, ולכן הוא לא מתאים למי שצריך מיפוי מדויק של הפריסה.

האם אפשר לכווץ אותו כדי שירוץ על חומרה חלשה יותר?

אפשר טכנית להריץ עליו כלי קוונטיזציה, אבל המפתחים לא בדקו את התוצאות ולא מבטיחים שהדיוק יישמר ברמה סבירה.

איך מריצים

המשקל בפורמט bfloat16 תופס כחמישה עשר וחצי גיגה בייט, כך שצריך כרטיס מסך בודד עם עשרים וארבעה גיגה בייט זיכרון כדי להרים אותו בצורה חלקה, למשל כרטיסי שרת נפוצים או כרטיסי קצה חזקים. היוצרים ממליצים להריץ אותו עם vLLM במנוע גרסה אחת שמספק שרת תואם לתקן של OpenAI.

אם נפח המסמכים שלכם נמוך מאוד או שאין לכם חומרה ייעודית זמינה שרצה כל הזמן, החזקה של כרטיס כזה בענן תעלה יותר משליחה נקודתית לספק חיצוני.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="reducto/RolmOCR")
print(pipe("שלום"))

הרישיון

הפרויקט זמין תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהטמיע אותו במוצרים פנימיים או חיצוניים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים ומצהירים על שינויים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗