GPT
C

chandra

קוד פתוח

datalab-toopenrail2025-10-21

  • transformers
  • safetensors
  • qwen3_vl
  • image-text-to-text
  • ocr

מודל ראייה ייעודי שמחלץ טקסט ממסמכים וסריקות ישירות למבנה של מרקדאון, ג'ייסון או דפי רשת. הוא נשען על בסיס של שמונה נקודה שמונה מיליארד פרמטרים ומתמחה בטבלאות וטפסים מורכבים.

  • 8.8Bפרמטרים
  • 262,144טוקנים בהקשר
  • 16.3 GBמשקל הקבצים
  • 12,935הורדות בחודש

מה זה

המודל מבוסס על הארכיטקטורה של Qwen 3 VL ועבר התאמה מלאה למשימות פענוח מסמכים. במקום לזרוק מחרוזת טקסט שטוחה, הוא שומר על מבנה העמוד ומחזיר סימון מסודר של טפסים עם תיבות סימון, נוסחאות מתמטיות וטבלאות צפופות. הוא יודע לעבד גם דיאגרמות, כולל תיאורי תמונה ונתונים מובנים מתוכן, ותומך ביותר מארבעים שפות.

בבדיקות מול מבחן olmocr המודל מציג ציון כולל של 83.1, מעל מודלים כמו dots.ocr או השירותים של מיסטרל ודיפסיק. היתרון הגדול שלו בא לידי ביטוי בסריקות ישנות, שם קיבל ציון של 50.4 לעומת פחות מ־35 אצל רוב המתחרים, ובטקסטים ארוכים וקטנים במיוחד. מצד שני, בזיהוי כותרות עליונות ותחתונות הוא מגיע ל־90.8, נמוך יותר מפתרונות אחרים שמתקרבים ל־95 ומעלה.

מתאים ל

  • המרת מאמרים ומסמכי מתמטיקה

    הוא מזהה משוואות ונוסחאות מורכבות היטב וממיר אותן ישירות לתחביר נקי יחד עם הטקסט שמסביב.

  • דיגיטציה של טפסים סרוקים

    מפענח בהצלחה כתב יד, שדות מילוי ותיבות סימון, ושומר על הקשר בין השדות לערכים שלהם.

  • חילוץ טבלאות מורכבות

    במבחני ביצועים על טבלאות הוא השיג 88 נקודות, ומייצר פלט מובנה של ג'ייסון או מרקדאון בלי לשבור עמודות.

איפה זה נופל

למרות ההצלחה בטקסט קשה, הדיוק שלו בסריקות ישנות עדיין עומד על 50.4 נקודות, כך שחצי מהחומר המאתגר עלול לצאת משובש ודורש בדיקה אנושית. המודל מתמחה בעיקר באנגלית ומסמכים טכניים, ולא מפורט אילו שפות נכללות בארבעים הנתמכות, כך שחובה לבדוק אותו מראש על מסמכים בעברית ולוודא שהוא לא הופך את כיוון הקריאה. נוסף על כך, הוא פחות מדויק בחילוץ עקבי של כותרות עמוד בהשוואה למודלים ייעודיים אחרים.

שאלות
נפוצות

איך הכי קל לבדוק אם הוא מתאים למסמכים שלי?

הדרך הפשוטה ביותר היא להתקין את chandra-ocr ולהריץ את פקודת chandra_app שפותחת ממשק streamlit מקומי. אפשר גם להעלות דוגמאות ישירות לפלייגראונד באתר של datalab בלי להתקין דבר על המחשב.

האם הוא מסוגל לקרוא מסמכים בעברית?

היוצרים מציינים תמיכה בלמעלה מארבעים שפות, אך לא פרסמו רשימה מפורטת. מומלץ להעלות כמה סריקות ישראליות טיפוסיות לממשק הבדיקה כדי לראות אם הטקסט והכיווניות נשמרים כמו שצריך לפני שמורידים את כל המשקלים.

איך מריצים

המשקל הכולל של הקבצים עומד על 16.3 גיגה־בייט, מה שאומר שכרטיס מסך בודד עם 24 גיגה זיכרון יספיק להרצה בסיסית. אפשר להריץ אותו דרך ספריית transformers הרגילה, אבל בשביל עיבוד קבצים כבדים וריצה מהירה יותר מומלץ לעבוד עם שרת vLLM דרך חבילת הפייתון הייעודית chandra-ocr.

המפתחים מציעים גם פלייגראונד פתוח וגישה בתשלום דרך ממשק מרוחק. אם אתם מעבדים עמודים בודדים מדי פעם או שאין לכם שרת ייעודי עם כרטיס מתאים שרץ כל הזמן, פנייה ישירה לשרת שלהם תחסוך את כאב הראש של ניהול התשתית.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="datalab-to/chandra")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון openrail. הרישיון מאפשר שימוש מסחרי, אבל כולל הגבלות שימוש ספציפיות שמטרתן למנוע פגיעה, אפליה או שימושים מזיקים. אם אתם משלבים אותו במוצר שלכם, אתם מחויבים להעביר את תנאי הרישיון הלאה למשתמשי הקצה ולוודא שהשימוש שלכם אינו מפר את המגבלות המוגדרות בו.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗