GPT
S

surya-ocr-2

קוד פתוח

datalab-toopenrail2026-05-14

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • ocr

מודל ראייה קומפקטי שמחלץ טקסט, טבלאות ומבנה עמוד ישירות לפורמט HTML. הוא מתאים למי שרוצה זיהוי מסמכים מהיר ומדויק בלי להחזיק כרטיסי מסך מפלצתיים.

  • 686Mפרמטרים
  • 262,144טוקנים בהקשר
  • 1.3 GBמשקל הקבצים
  • 1,258,621הורדות בחודש

מה זה

המודל תופס נפח של 1.3 גיגה בייט בלבד ומבוסס על ארכיטקטורת Qwen3.5. במקום לפצל את העבודה בין כמה מודלים נפרדים, הוא מרכז פענוח טקסט, ניתוח מבנה וזיהוי טבלאות בתוך מודל ראייה יחיד. חילוץ שורות הטקסט הבסיסי עדיין נשען על מודל סגמנטציה נפרד בטורץ', אבל שאר הניתוח מתבצע במעבר אחד.

במבחן olmOCR-bench הוא מגיע לציון של 83.3 נקודות, שזה ביצועים ברמה של מודלים ששוקלים פי ארבעה וחמישה ממנו. מעבר לאנגלית, המפתחים מדווחים על ציון ממוצע של 87.2 אחוזים בבדיקה פנימית של 91 שפות. פלט הטבלאות מחזיר קואורדינטות מדויקות או תגיות HTML מלאות כולל מיזוג תאים, ומשוואות מתמטיות מתורגמות ישירות לקוד לאטך.

מתאים ל

  • המרת PDF לטקסט מובנה

    חילוץ עמודים שלמים ישירות ל־HTML מסודר כולל סדר קריאה נכון וכותרות.

  • חילוץ טבלאות מורכבות

    זיהוי מבנה של שורות ועמודות כולל מיזוג תאים מתוך דוחות פיננסיים וטפסים.

  • דיגיטציה של מאמרים מדעיים

    זיהוי נוסחאות מתמטיות כחלק מהטקסט הרציף ותרגומן לתגיות KaTeX.

איפה זה נופל

הנקודה החלשה ביותר שלו היא סריקות ישנות ופגומות, שבהן שיעור ההצלחה במבחנים צונח ל־41.8 אחוז בלבד. בנוסף, הוא מאומן על מסמכים בלבד ולא מתאים לזיהוי טקסט בתוך תמונות מהעולם האמיתי כמו שלטי רחוב או צילומי חוץ.

הטבלאות במצב הפשוט דורשות חישוב הצטלבויות ידני בין שורות לעמודות, ופלט מלא זמין רק במצב חיזוי מורחב. תמונות ברזולוציה שמעל 2048 פיקסלים או תמונות מטושטשות מחייבות עיבוד מקדים כדי למנוע קריסה באיכות הזיהוי.

שאלות
נפוצות

כמה זיכרון כרטיס מסך צריך כדי להריץ אותו?

המודל שוקל 1.3 גיגה בייט בלבד, כך שהוא נכנס בקלות גם בכרטיסים קטנים של 8 או 12 גיגה בייט. צוואר הבקבוק הוא לא המשקולות אלא כמות העמודים שמריצים במקביל דרך vllm. אם מעלים את כמות הבקשות המקבילות כדי לסחוט ביצועים גבוהים, מומלץ כרטיס עם 16 גיגה בייט זיכרון ומעלה.

האם המודל תומך בזיהוי עברית?

המפתחים מדווחים על תמיכה ב־91 שפות, אך עברית אינה מופיעה ברשימת 15 השפות המובילות שפורסמו בכרטיס. שפות עם כיווניות מימין לשמאל כמו ערבית ופרסית מקבלות ציונים נמוכים יותר של 72 עד 82 אחוז לעומת שפות אירופיות. חובה לבדוק אותו על מדגם מסמכים מקומי לפני שמסתמכים עליו בעברית.

איך מריצים

המודל רץ מעל שרתי הסקה סטנדרטיים, vllm לכרטיסי אנבידיה או llama.cpp למעבדים רגילים ומחשבי מק. ספריית הפייתון של הפרויקט מרימה את השרת הזה לבד ברקע, אבל בהפקה עדיף להרים מופע עצמאי ולחבר את הספרייה בכתובת רשת מקומית.

על כרטיס RTX 5090 יחיד עם 32 גיגה בייט זיכרון, הוא מגיע לקצב של מעל 5 עמודים בשנייה במקביליות גבוהה. על מחשב מק דרך llama-server המהירות צונחת לעמוד אחד בכל עשר שניות בערך. אם אין לכם גישה לכרטיס מסך ייעודי או שהנפח נמוך מאוד, עדיף להשתמש בפלטפורמת הענן של החברה שמציעה קרדיט התחלתי של 5 דולר.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="datalab-to/surya-ocr-2")
print(pipe("שלום"))

הרישיון

הקוד פתוח תחת אפאצ'י 2.0, אבל משקולות המודל מופצות ברישיון OpenRAIL מותאם. השימוש חופשי למחקר, לשימוש אישי ולסטארטאפים שגייסו או הכניסו פחות מ־5 מיליון דולר. חברות גדולות יותר שמכניסות את המודל למוצר מסחרי צריכות לקנות רישיון מסחרי ייעודי מהחברה.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗