GPT
U

Unlimited-OCR

קוד פתוח

baidumit2026-06-19

  • transformers
  • safetensors
  • unlimited-ocr
  • feature-extraction
  • baidu

מודל ראייה ושפה קומפקטי שמתמקד בחילוץ טקסט וקריאת מסמכים ארוכים בתמונה אחת. הוא פונה למי שצריך לפענח דפים צפופים בלי לשלם על מודל ענק.

  • 3.3Bפרמטרים
  • 32,768טוקנים בהקשר
  • 6.3 GBמשקל הקבצים
  • 2,727,789הורדות בחודש

מה זה

מדובר במודל של 3.3 מיליארד פרמטרים שמיועד למשימות תמונה לטקסט, בעיקר סביב ניתוח מסמכים מורכבים. ביידו בנו אותו על בסיס רעיונות ממיזמים כמו דיפסיק ופאדל, במטרה להתמודד עם אתגר של עיבוד רצוף וארוך באותו מסמך בלי לאבד הקשר. עם חלון של 32,768 טוקנים, הוא מסוגל לקלוט תמונות ברזולוציה גבוהה או דפים עמוסים ולפלוט את כל המלל באופן סדור.

בגודל של 6.3 גיגה בייט הוא יושב בדיוק במשבצת של מודלים שאפשר להחזיק עצמאית בלי לקרוע את התקציב. הוא לא מתיימר להיות מודל שיחה כללי, אלא סוס עבודה שנועד להמיר סריקות, קובצי פי די אף ותרשימים לטקסט קריא ומובנה.

מתאים ל

  • עיבוד מסמכים סרוקים

    הוא מיועד לחילוץ טקסט מלא מדפי פי די אף וסריקות ארוכות ישירות לפורמט ספרתי בלי לחתוך את התמונה.

  • קריאת טפסים וטבלאות

    השילוב של חלון הקשר של 32 אלף טוקנים וארכיטקטורת ראייה מתאים לפענוח מבנה עמוד מורכב.

  • מערכות עיבוד פנימיות

    הגודל הקל מאפשר להרים שרת מבוסס vLLM ברשת סגורה בלי להוציא מידע רגיש החוצה.

איפה זה נופל

למרות שהוא מתויג כמולטילינגואל, התיעוד לא מפרט אילו שפות נתמכות ובאיזו איכות. ישראלים שצריכים עברית חייבים לבדוק אותו ביסודיות על מסמכים מקומיים לפני שרצים קדימה, כי פונטים מורכבים וטקסט מימין לשמאל הם המקום שבו מודלים כאלה נוטים לטעות. בנוסף, מדובר במודל ממוקד קריאה, כך שאל תצפו ממנו לתפקד כמו מודל חשיבה או לפתור בעיות היגיון מחוץ לטקסט הנתון.

שאלות
נפוצות

האם הוא יודע לקרוא עברית בצורה אמינה?

הכרטיס מציין תמיכה בריבוי שפות, אך לא מפרט לגבי עברית. לפני שמכניסים אותו לתהליך עבודה קבוע, מומלץ לקחת כמה דוגמאות של מסמכים וחשבוניות בעברית ולבדוק אם הוא מזהה את האותיות והסדר הנכון.

באיזו תשתית כדאי להריץ אותו בפרודקשן?

עדיף להשתמש ב־vLLM או ב־SGLang ולא בספריית transformers הרגילה. המפתחים סיפקו תמונות דוקר והגדרות שרת מוכנות, וזה נותן ביצועים וקצב עיבוד גבוהים בהרבה.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך בודד עם לפחות 12 עד 16 גיגה זיכרון גרפי, שבו הוא יישב בפורמט bfloat16 בלי בעיה. יש לו כבר תמיכה מובנית בספריות הסקה מהירות כמו vLLM ו־SGLang, כולל תמונות דוקר מוכנות להרצה מקומית או בשרת ענן עם תאימות ל־CUDA.

אם יש לכם שרת מקומי עם חומרה מתאימה, ההרצה העצמית משתלמת מאוד מבחינת זמני תגובה ופרטיות. אם היקף המסמכים שלכם נמוך או משתנה בצורה קיצונית, יש לו גם גרסה מנוהלת בענן של ביידו, מה שחוסך את התחזוקה של הברזלים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="baidu/Unlimited-OCR")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים מופצים תחת רישיון MIT. המשמעות פשוטה, מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לשלב אותו בתוך מוצר סגור ולהפיץ אותו חופשי, כל עוד משאירים את הצהרת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗