GPT
C

chandra-ocr-2

קוד פתוח

datalab-toopenrail2026-03-16

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • ocr

המרת סריקות ומסמכים מורכבים לפורמטים מובנים כמו Markdown וטבלאות ברמת דיוק גבוהה. מתאים למי שצריך לפענח טפסים, כתב יד ונוסחאות מתמטיות ישירות מקובצי תמונה ו־PDF.

  • 5.3Bפרמטרים
  • 262,144טוקנים בהקשר
  • 9.9 GBמשקל הקבצים
  • 2,917,658הורדות בחודש

מה זה

המודל פותח על ידי datalab-to ומשמש כמחלץ טקסט מתמונות ומסמכים שמחזיר Markdown, HTML או JSON תוך שמירה על המבנה המקורי של העמוד. המודל מתמודד בהצלחה עם טפסים שמכילים תיבות סימון, כתב יד סרוק, טבלאות מורכבות ודיאגרמות, כולל הפקת תיאור לתמונות. הוא מבוסס על ארכיטקטורת Qwen3.5 וכולל 5.3 מיליארד פרמטרים, גודל שמאפשר הפעלה עצמית על חומרה מקומית סבירה מבלי להתפשר על פענוח פריסות עמוד רחבות.

במבחני ביצועים של olmOCR הוא השיג ציון כללי של 85.8, ועקף מודלים כמו olmOCR 2 ו־Deepseek OCR, במיוחד בקריאת טבלאות עם 92.1 ובטקסט צפוף עם 93.7. במבחן הרב־לשוני המודל תומך ביותר מ־90 שפות ומציג דיוק ממוצע של 77.8 אחוזים ב־43 השפות הנפוצות. בעברית ספציפית הוא קיבל ציון של 70.4 אחוזים, שזה זינוק משמעותי לעומת 38.9 בגרסה הקודמת, ועדיין משאיר פער מסוים שדורש בדיקה מעשית על החומרים שלכם.

מתאים ל

  • המרת מאמרים ודוחות לטקסט

    מחלץ נוסחאות מתמטיות, טבלאות עמוסות וגרפים ישירות לקובצי Markdown מובנים בלי לאבד את סדר הקריאה המקורי.

  • דיגיטציה של טפסים

    מזהה שדות כתובים ביד, תיבות בחירה מסומנות ומבנים טבלאיים ומחזיר אותם ישירות בפורמט JSON מסודר.

  • חילוץ מידע בעברית ובשפות נוספות

    מספק יכולת OCR רב־לשונית למסמכים שמשלבים כמה שפות במקביל, כולל עברית, על בסיס מודל מקומי עצמאי.

איפה זה נופל

החולשה הבולטת ביותר של המודל היא סריקות ישנות או פגומות, שם הוא מגיע לציון של 51.1 בלבד במבחני olmOCR. בנוסף, זמני ההמתנה בעיבוד אצוות כבדות יכולים להגיע ליותר מדקה לעמוד תחת עומס. למרות השיפור בעברית, ציון של כ־70 אחוז מעיד שעדיין יהיו שגיאות תעתיק במסמכים מקומיים מורכבים, ולכן חובה לבצע בדיקה מקדימה על דוגמאות מתוך המערכת שלכם לפני הטמעה רחבה.

שאלות
נפוצות

כמה זיכרון כרטיס מסך נדרש כדי להריץ אותו מקומית?

המודל שוקל 9.9 גיגה־בייט בפורמט bfloat16, כך שתצטרכו כרטיס מסך עם לפחות 16 גיגה זיכרון כדי לטעון אותו, ועדיף 24 גיגה ומעלה לעיבוד מסמכים ארוכים עם חלון הקשר מלא. שימוש ב־vLLM יעזור לנצל את הזיכרון טוב יותר ולשמור על קצב עיבוד יציב.

איך המודל מתמודד עם טקסטים בעברית?

במבחן הרב־לשוני המודל השיג 70.4 אחוזים בעברית, שיפור חד לעומת 38.9 בגרסה הראשונה ותוצאה טובה יותר מ־Gemini 2.5 Flash שנבדק מולו. עם זאת, בטקסטים סרוקים באיכות נמוכה או פונטים חריגים עדיין צפויות טעויות זיהוי.

האם מותר לשלב אותו במוצר מסחרי?

המשקולות זמינות לשימוש מסחרי רק עבור חברות וסטארטאפים עם מימון או הכנסות של פחות משני מיליון דולר. אם עברתם את הסכום הזה או שאתם מפתחים מוצר שמתחרה ישירות בשירותי החברה המפתחת, עליכם להסדיר מולם רישיון בתשלום.

איך מריצים

משקל הקבצים עומד על כמעט עשרה גיגה־בייט ב־bfloat16, כך שתצטרכו כרטיס מסך עם לפחות 16 עד 24 גיגה זיכרון כדי לטעון אותו ולהריץ הסקה בצורה חלקה. הדרך המומלצת להרצה היא דרך vLLM שמאפשרת להגיע לתפוקה של כ־1.4 עד 2 עמודים בשנייה בשרתים חזקים, או דרך ספריית transformers הרגילה בפייתון.

אם אתם צריכים לפענח אלפי מסמכים במקביל ואין לכם שרת ייעודי זמין, קריאה ל־API של החברה תהיה פשוטה ומהירה יותר מניהול תשתית עצמאית. כמו כן, בבנצ'מרקים ה־API שלהם הציג תוצאות מעט גבוהות יותר מהמודל הפתוח, במיוחד בסריקות ישנות.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="datalab-to/chandra-ocr-2")
print(pipe("שלום"))

הרישיון

הקוד ברישיון Apache 2.0, אך משקולות המודל מופצות תחת גרסה מותאמת של OpenRAIL-M. השימוש מותר בחינם למחקר, לפרויקטים אישיים ולסטארטאפים עם גיוס או הכנסות מתחת לשני מיליון דולר. אם חציתם את הרף הזה או שאתם בונים שירות שמתחרה ישירות ב־API של datalab-to, תצטרכו לרכוש רישיון מסחרי ייעודי.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗