GPT
D

dots.ocr

קוד פתוח

dots-studiomit2025-07-30

  • dots_ocr
  • safetensors
  • text-generation
  • image-to-text
  • ocr

מודל ראייה ושפה קומפקטי שמחלץ מטקסטים סרוקים ומסמכים מורכבים את התוכן, המבנה וסדר הקריאה. הוא חוסך שרשור של מודלי זיהוי נפרדים ומציג דיוק מרשים ביחס לגודלו.

  • 3Bפרמטרים
  • 131,072טוקנים בהקשר
  • 5.7 GBמשקל הקבצים
  • 270,473הורדות בחודש

מה זה

dots.ocr מגיע עם שלושה מיליארד פרמטרים ומבוסס על שפת אם של 1.7 מיליארד פרמטרים. במקום להשתמש במערכת מסורבלת שמשלבת מודל כמו YOLO לזיהוי מיקומים ומודל נפרד לקריאת הטקסט, הוא עושה את שני הדברים יחד דרך פרומפט. שינוי ההנחיה קובע אם תקבלו רק את תיבות המיקום של אלמנטים בעמוד, או פיענוח מלא למרק-דאון ששומר על מבנה הטבלאות וסדר הזרימה של הטקסט.

במבחני ביצועים של OmniDocBench על מסמכים באנגלית ובסינית, הוא השיג שגיאת עריכה כוללת נמוכה יותר מכלים מובילים ומשתווה בעבודה מול טבלאות למודלים ענקיים כמו Gemini 2.5 Pro. המבחנים על דוחות כספיים, עיתונים ומאמרים אקדמיים הראו זיהוי חד, בעיקר סביב פירוק של מבנים מרובי עמודות ושמירה על סדר קריאה הגיוני, אם כי בנוסחאות מתמטיות יש מודלים ייעודיים שעדיין עוקפים אותו.

מתאים ל

  • המרת דוחות כספיים

    חילוץ מדויק של טבלאות מורכבות ממסמכי PDF סרוקים אל מבנה נתונים מסודר.

  • זיהוי מבנה בעמוד

    קבלת תיבות גבול של תמונות, נוסחאות וטקסט בלי להרים שרת נפרד ל־YOLO.

  • עיבוד מאמרים אקדמיים

    פיענוח מסמכים מרובי עמודות ושמירה על סדר הקריאה התקין לכל אורך הדף.

איפה זה נופל

בסריקות ישנות של מסמכים ובמתמטיקה מורכבת הוא נופל מול מודלים מסחריים גדולים. במבחן olmOCR על סריקות ישנות עם נוסחאות הוא קיבל ציון של 64.2 לעומת 75.5 של GPT-4o, ועל סריקות ישנות בכלל עמד על 40.9 בלבד. בנוסף, זיהוי של כתבי יד והערות פחות יציב אצלו ביחס לדפוס סטנדרטי. אם יש לכם צורך בעברית, קחו בחשבון שהבנצ'מרקים בכרטיס המודל נבדקו בעיקר באנגלית ובסינית, ואין התחייבות רשמית לגבי יכולות הפענוח של אלפבית שמי, כך שתצטרכו לבדוק את זה ידנית לפני שתבנו עליו.

שאלות
נפוצות

אפשר להריץ אותו מקומית על מחשב בלי כרטיס שרת?

כן, המודל שוקל 5.7 ג'יגה בייט ודורש מעט משאבים יחסית לביצועים שלו. כרטיס מסך מודרני עם 12 עד 16 ג'יגה זיכרון יספיק לטעינה ולהסקה סבירה.

איך עוברים בין זיהוי מיקומים לבין חילוץ טקסט מלא?

לא צריך להחליף מודל או לטעון משקלים אחרים. המעבר מתבצע אך ורק באמצעות החלפת הפרומפט ששולחים למודל, לפי ההגדרות שמגיעות עם הספרייה שלו.

האם הוא מתאים לעיבוד סריקות ישנות באיכות גרועה?

זה לא הצד החזק שלו. המדדים מראים ירידה בביצועים על חומרים סרוקים ישנים, במיוחד כשיש בהם מתמטיקה, ושם מודלים מסחריים גדולים עדיין עובדים טוב יותר.

איך מריצים

המשקל הכולל של הקבצים עומד על 5.7 ג'יגה בייט בפורמט bfloat16. זה אומר שאפשר להריץ אותו בנוחות על כרטיס מסך בודד של 12 או 16 ג'יגה זיכרון, כמו כרטיסים ביתיים חזקים או שרת ענן פשוט וזול.

המפתחים ממליצים להריץ אותו ישירות דרך vLLM גרסה 0.9.1 או באמצעות תמונת ה־Docker הייעודית שלהם. שימו לב שיש כרגע מגבלה טכנית מוזרה שמחייבת לשמור את המשקלים בתיקייה בלי נקודות בשם כדי למנוע קריסה, עד שהתמיכה ב־Transformers תושלם במלואה.

pip install -U huggingface_hub
hf download dots-studio/dots.ocr

הרישיון

המודל שוחרר ברישיון MIT חופשי לחלוטין. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים סגורים ולהפיץ אותו הלאה, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗