GPT
L

LightOnOCR-mix-0126

קוד פתוח

lightonaiother2026-01-15

  • ocr

עשרות מיליוני תמלולי עמודים שחולצו ממסמכי רשת באמצעות זיקוק ממודל ראייה שפה מתקדם. המטרה היא לאמן מודלי זיהוי תווים שמחזירים מרקדאון נקי, כולל טבלאות ונוסחאות מתמטיות.

  • 536הורדות בחודש
  • 112לייקים

מה זה

המאגר כולל עשרות מיליוני רשומות, כאשר כל שורה מייצגת עמוד בודד מתוך מסמך. הטקסט מסודר בסדר קריאה טבעי ומכיל מבנה מלא: כותרות, רשימות, טבלאות מתויגות ב־HTML מינימלי ללא עיצוב, ונוסחאות מתמטיות בפורמט LaTeX. התמלולים הופקו על ידי מודל מורה מסוג VLM מתוך קובצי PDF שמקורם בקורפוס PDFA של SafeDocs מתוך Common Crawl.

הטקסט הגולמי עבר תהליך ניקוי שכלל הסרת גדרות קוד מיותרות, האחדת רווחים, סינון כפילויות ולולאות חזרתיות, ואימות תקינות של נוסחאות המתמטיקה. תיבות גבול של תמונות שהמודל פלט הוסרו מהיעד המרכזי והועברו למאגר נפרד, כך שהטקסט כאן כולל רק מצייני מקום לתמונות.

נקודה שחובה להבין לפני שמתחילים: המאגר אינו מכיל את קובצי ה־PDF המקוריים או תמונות מרונדרות של העמודים. כדי לאמן מודל ראייה, יש להוריד את קובצי המקור מקורפוס חיצוני ולהתאים ביניהם לפי המזהים.

מתאים ל

  • אימון מודלי OCR למסמכים

    פיקוח מקצה לקצה על פלט טקסטואלי עשיר הכולל טבלאות ונוסחאות LaTeX לפי סדר קריאה.

  • מבחני יציבות לנוסחאות

    בדיקת יכולת המודל לשחזר מבנה מתמטי וטבלאות בצורה עקבית ללא שבירת תחביר.

  • מחקר על זיקוק ממודלי ראייה

    ניתוח טיב התמלול של מודל מורה והשפעת סינון רעשים על יציבות מודל יעד קטן.

איפה זה נופל

התמלולים נוצרו על ידי מכונה ולא נבדקו ידנית אחד אחד, ולכן קיימות הזיות ושגיאות עימוד במבנים מורכבים במיוחד. המאגר נשען בעיקר על שפות אירופיות, למרות שהוגדרו שפות נוספות כמו יפנית, סינית ורוסית. עברית אינה ברשימת השפות הנתמכות, ומסמכים מישראל או טקסט מימין לשמאל לא נכללו בתכנון. בנוסף, חוסר בתמונות המקוריות מייצר עבודת הנדסה כבדה של סנכרון מול מאגר חיצוני לפני שאפשר להתחיל אימון.

שאלות
נפוצות

האם יש במאגר טקסט בעברית?

לא. רשימת השפות הרשמית כוללת שתים עשרה שפות, רובן אירופיות לצד סינית ויפנית. עברית אינה נתמכת כאן, ולכן הוא לא מתאים לאימון מודלים שמיועדים למסמכים מקומיים.

האם אפשר להשתמש בדאטהסט לאימון מסחרי?

זה מורכב. הרישיון מסומן כ־other וכפוף לתנאי השימוש של Common Crawl ו־Digital Corpora, מהם נלקחו המסמכים המקוריים. יש לבדוק את התנאים של גופים אלה לפני שמשלבים את המידע במוצר מסחרי.

האם הקבצים כוללים תמונות של העמודים?

לא. המאגר מכיל אך ורק את התמלולים, המטא-דאטה ומזהי המסמכים. כדי להשתמש בו לאימון מודל ראייה צריך להוריד את קובצי ה־PDF המקוריים ממאגר נפרד בשם pixparse/pdfa-eng-wds ולרנדר אותם עצמאית.

איך נאספו התמלולים של העמודים?

הטקסט לא הועתק ישירות מהקובץ אלא יוצר באמצעות זיקוק ממודל ראייה שפה מתקדם ששימש כמורה. לאחר מכן עבר הטקסט ניקוי שכלל אימות תקינות של נוסחאות LaTeX, מחיקת לולאות חזרתיות והסרת תגיות עיצוב מיותרות.

איך טוענים

הנתונים מחולקים לעשרות קובצי Parquet, לפחות 79 קבצים עם התחילית pdfa_train, ללא צורך באישור גישה מיוחד. כל רשומה מחזיקה מזהה מסמך, מספר עמוד, את תוכן הטקסט המנורמל, ומטא-דאטה שכולל ספירת נוסחאות, טבלאות, תמונות ואורך בטוקנים לפי הטוקנייזר של LightOnOCR. מכיוון שאין כאן תמונות, השימוש דורש משיכה נפרדת של קובצי המקור מ־pixparse/pdfa-eng-wds וחיבורם לפי מזהה המסמך.

from datasets import load_dataset

ds = load_dataset("lightonai/LightOnOCR-mix-0126")

הרישיון

הרישיון מוגדר כ־other ונשען על תנאי השימוש של מקורות המידע: Common Crawl ופרויקט Digital Corpora. המפרסמים לא חילקו רישיון חופשי עצמאי, ולכן שימוש מסחרי במודל שאומן עליו דורש בדיקה משפטית קפדנית של תנאי הזחילה המקוריים מ־2021. אי אפשר להניח שמותר למכור תוצרים בלי לעמוד במגבלות של הגורמים הללו.

הרישיון המלא ב־Hugging Face ↗