GPT
L

LightOnOCR-1B-1025

קוד פתוח

lightonaiapache-2.02025-10-20

  • transformers
  • safetensors
  • mistral3
  • text-generation
  • ocr

מודל ראייה ושפה קומפקטי לחילוץ טקסט ממסמכים ותמונות. הוא שוקל מעט, רץ מהר מאוד ולא דורש צינור עיבוד נפרד לתמונות.

  • 1.2Bפרמטרים
  • 8,192טוקנים בהקשר
  • 2.2 GBמשקל הקבצים
  • 72,083הורדות בחודש

מה זה

הארכיטקטורה מחברת מקודד תמונה שמבוסס על Pixtral יחד עם מפענח טקסט שמבוסס על Qwen3, לאחר שעבר זיכוך ממודלים גדולים יותר. בניגוד לפתרונות OCR מסורתיים שמפרקים את התהליך לזיהוי בלוקים בנפרד וקריאת אותיות בנפרד, כאן הכל נעשה מקצה לקצה ברשת אחת שמבינה פריסה מורכבת של עמוד.

היתרון המרכזי שלו מתבטא ביחס שבין משקל לביצועים. המפתחים מציגים מהירות של פי חמישה בהשוואה ל־dots.ocr ופי שניים מול PaddleOCR-VL-0.9B, כשהוא מגיע לקצב של 5.71 עמודים בשנייה על כרטיס H100 בודד, מה שמתרגם לעלות נמוכה מאוד בקנה מידה רחב.

מתאים ל

  • חילוץ נתונים מחשבוניות

    מפענח טבלאות, קבלות וטפסים מורכבים באנגלית ושפות אירופיות במהירות גבוהה ובמחיר חומרה זניח.

  • סריקת מאמרים מדעיים

    שומר על מבנה של טקסט מרובה עמודות ומזהה נוסחאות מתמטיות ישירות מתוך קובץ התמונה.

  • דיגיטציה של ארכיונים

    מטפל בנפח של מאות אלפי עמודים ביום על כרטיס בודד בעלות של פחות מסנט לכל אלף דפים.

איפה זה נופל

המודל מוגדר רשמית לשמונה שפות אירופיות בלבד: אנגלית, צרפתית, גרמנית, ספרדית, איטלקית, הולנדית, פורטוגזית ושוודית. עברית לא נתמכת כאן, ולכן הוא לא רלוונטי למסמכים מקומיים. בנוסף, חלון ההקשר מוגבל ל־8,192 טוקנים, והמפתחים מציינים במפורש שיש כבר גרסה חדשה יותר, LightOnOCR-2, שמציגה תוצאות עדיפות במבחני הביצועים.

שאלות
נפוצות

האם המודל יודע לקרוא מסמכים בעברית?

לא. רשימת השפות הנתמכות כוללת שפות לטיניות בלבד, ועברית אינה מופיעה בה. ניסיון להריץ אותו על טקסט עברי יניב פלט משובש או ריק.

איך מכינים את הקבצים כדי לקבל תוצאה מדויקת?

המפתחים ממליצים להמיר את עמודי ה־PDF לתמונות PNG או JPEG שבהן הצלע הארוכה ביותר היא 1540 פיקסלים. יש לשמור על יחס הגובה והרוחב המקורי ולהזין עמוד בודד בכל פעם.

איך מריצים

המשקל הכולל של הקבצים עומד על 2.2 ג'יגה בייט בפורמט BF16 מלא, כך שאפשר להריץ אותו בקלות על כל כרטיס מסך מודרני פשוט, אפילו ברמת צרכנים עם 6 עד 8 ג'יגה זיכרון. התמיכה המובנית קיימת ב־vLLM החל מגרסה 0.11.1, וזה הנתיב העדיף לשרת פרודקשן שצריך לטפל בקצב גבוה. עבור ספריות transformers נדרשת התקנה ישירות ממאגר הגיטהאב של המפתחים.

אם אתם צריכים רק כמה עשרות דפים ביום ולא רוצים לתחזק שרת דלוק, אפשר פשוט להשתמש ב־API מנוהל חיצוני. לעומת זאת, ברגע שיש נפח של אלפי מסמכים, העלות על חומרה עצמית תהיה שבריר סנט לאלף דפים.

from transformers import pipeline

pipe = pipeline("image-to-text", model="lightonai/LightOnOCR-1B-1025")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון Apache 2.0. הרישיון מתיר שימוש מסחרי מלא, שינוי של הקוד, הפצה והטמעה במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗