GPT
L

LightOnOCR-2-1B

קוד פתוח

lightonaiapache-2.02026-01-16

  • transformers
  • safetensors
  • mistral3
  • text-generation
  • ocr

מודל חזותי קטן לחילוץ טקסט שממיר מסמכים ישירות למלל נקי, כולל טבלאות ונוסחאות. הוא נבנה כדי לחסוך פייפליינים מורכבים ולהריץ כמויות גדולות של דפים בעלות אפסית.

  • 1Bפרמטרים
  • 16,384טוקנים בהקשר
  • 1.9 GBמשקל הקבצים
  • 237,414הורדות בחודש

מה זה

מדובר במודל ראייה ושפה מקצה לקצה שמבצע OCR ישיר מסריקות, תמונות וקבצי PDF בלי להסתמך על מערכות חיתוך וזיהוי חיצוניות. הוא מאומן על קורפוס שכולל מאמרים מדעיים, סריקות וטפסים, ומשתמש באימון מבוסס RLVR כדי לשמור על סדר קריאה טבעי. המודל שולף ישירות טבלאות, מבנים של מספר עמודות, קבלות ונוסחאות מתמטיות בפורמט LaTeX.

במבחני OlmOCR-Bench המודל מציג דיוק מוביל ביחס למתחרים כבדים בהרבה, תוך שהוא מהיר פי 1.7 מ־OlmOCR ופי 1.73 מ־DeepSeekOCR. היתרון המשמעותי הוא השילוב בין גודל קומפקטי למהירות עיבוד גבוהה, שמגיעה ל־5.71 דפים בשנייה על כרטיס H100 בודד.

מתאים ל

  • סריקת מאמרים מדעיים

    הוא אומן על מאמרי arXiv וממיר משוואות מתמטיות מורכבות ישירות לקוד LaTeX נקי.

  • חילוץ נתונים מטפסים וקבלות

    מבנה הקצה לקצה מזהה שדות וטבלאות רב-טוריות ללא צורך בהגדרת אזורים ידנית מראש.

  • עיבוד מסמכים אירופיים

    הוא כולל תמיכה חזקה בצרפתית ובשפות אירופיות נוספות, ומתאים לפעילות מול חברות בינלאומיות.

איפה זה נופל

הבעיה המרכזית עבור מפתחים בארץ היא היעדר תמיכה בעברית. רשימת השפות הרשמית כוללת אנגלית, צרפתית, גרמנית, ספרדית, איטלקית, הולנדית, פורטוגזית ושוודית בלבד. ניסיון לחלץ ממנו מסמכים בעברית צפוי לייצר ג'יבריש או שגיאות קשות.

בנוסף, המודל מחייב עיבוד מקדים מדויק של התמונה לפי ההנחיות שלהם כדי לשמור על יחס תצוגה תקין, ושימוש בגרסת transformers ישנה מגרסה 5 פשוט לא יעבוד.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה למסמכים בעברית?

לא. רשימת השפות הנתמכות מכסה שפות אירופיות בלבד, ועברית אינה נכללת בהן. אם תנסו לעבד מסמך בעברית תקבלו פלט שגוי, אלא אם תבצעו אימון נוסף ייעודי על בסיס גרסת ה־base.

האם צריך כרטיס מסך מפלצתי בשביל להריץ אותו בהפקה?

ממש לא. המודל שוקל 1.9 גיגה בייט בלבד עם כמיליארד פרמטרים. אפשר להריץ אותו בקלות על כרטיסי מסך בסיסיים, אם כי על כרטיס חזק כמו H100 הוא מסוגל לדחוף קצב של כמעט חצי מיליון דפים ביום.

איך מריצים

המשקל הכולל הוא 1.9 גיגה בייט, כך שאפשר להריץ אותו בקלות על כרטיס מסך ביתי צנוע ואפילו על מעבד חזק בלי לשבור את הראש. המודל נתמך בספריית transformers מגרסה 5 ומעלה, וניתן להרים אותו לשרת הפקה ישירות באמצעות vLLM עם הגבלת תמונה בודדת לכל פרומפט. אם אתם מעבדים קובצי PDF, המפתחים ממליצים לרנדר אותם מראש ברזולוציה של 200 DPI כך שהצלע הארוכה תהיה 1540 פיקסלים.

גרסה זו היא גרסת הדגל המומלצת לשימוש שוטף, אבל אם המטרה היא התאמה אישית לדומיין ספציפי עדיף לקחת את גרסת הבסיס LightOnOCR-2-1B-base. אם יש לכם צורך בזיהוי מיקום תמונות בתוך הדף, יש להם גרסאות ייעודיות עם סיומת bbox שפולטות תיחום מתאים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="lightonai/LightOnOCR-2-1B")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני לחלוטין שמאפשר שימוש מסחרי, שינוי של המשקולות, אימון נוסף ושילוב במוצרים סגורים, בלי לשלם תמלוגים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗