GPT
D

DoclingMatix

קוד פתוח

HuggingFaceM4cdla-permissive-2.02025-07-22

  • docvqa
  • ocr
  • document-conversion

מעל 1.2 מיליון דוגמאות של תמונות מסמכים עם הנחיות להמרה לפורמט מובנה, שנבנו במקור לאימון מודל SmolDocling. הוא מיועד למי שמפתח מודלי ראייה ושפה להבנת מבנה של דפי מידע.

  • 6,519הורדות בחודש
  • 55לייקים

מה זה

המאגר מכיל בדיוק 1,270,911 רשומות, וכולן יושבות תחת סט אימון יחיד ללא חלוקה מובנית לולידציה או מבחן בכרטיס. הבסיס מגיע מהרחבה ישירה של הדאטהסט Docmatix. כל רשומה כוללת תמונת מסמך יחד עם שאלות ותשובות שהיו במקור, אך כאן הוסיפו לטקסט הנחיה ברורה שמכוונת את המודל להמיר את המסמך הוויזואלי לפורמט טקסט מובנה בשם DocTag.

המבנה הזה נועד לאימון מודלים שממלאים הוראות, כך שהקלט הוא תמונה והפלט הוא ייצוג מובנה ומסודר של תוכן המסמך. מעבר להמרה ישירה של מסמכים, הרשומות כוללות זוגות של שאלות ותשובות שמבוססים על התוכן והמבנה, כך שאפשר להשתמש בו גם למשימות מענה על שאלות חזותיות מתוך מסמכים.

מתאים ל

  • אימון מודלי המרת מסמכים

    למידה מקצה לקצה מתמונת דף לייצוג טקסטואלי מובנה.

  • מענה על שאלות ממסמכים

    אימון מערכות visual question answering על גבי דוחות ודפים.

  • אימון למילוי הנחיות

    כוונון מודלי שפה וראייה לעיבוד מסמכים לפי פרומפט קבוע.

איפה זה נופל

הנתונים מוגדרים תחת השפה האנגלית בלבד, כך שאין כאן תמיכה במסמכים בעברית או במבנה מימין לשמאל. המאגר כולל רק סט אימון, ולכן תצטרכו להקצות בעצמכם נתונים לבדיקה כדי להעריך תוצאות בצורה הוגנת. הפלט מוכוון ספציפית לפורמט הייעודי DocTag, ואם אתם זקוקים למבנה סטנדרטי אחר כמו JSON רגיל או Markdown, תצטרכו לעבד את הנתונים מחדש.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון המדווח, cdla-permissive-2.0, הוא רישיון מתירני שמאפשר שימוש מסחרי מלא באימון מודלים ובמחקר. תצטרכו רק לתת ייחוס מתאים למפרסמים לפי הדרישות ברישיון.

האם הדאטהסט מתאים לעבודה עם מסמכים בעברית?

לא. המאגר מוגדר כמאגר באנגלית בלבד, ואינו כולל נתונים בעברית או תמיכה בטקסט מימין לשמאל. אם אתם בונים מערכת למסמכים מקומיים, תצטרכו לאסוף מידע נוסף בנפרד.

באיזה פורמט שמורים הקבצים וכמה יש כאלה?

הנתונים מחולקים ל־1,106 קובצי Parquet שונים שמכילים את התמונות והטקסט. המבנה הזה נועד לטעינה נוחה בספריות עיבוד נתונים, אך דורש תשתית מתאימה להורדה של כמות קבצים כזו.

מה ההבדל בין המאגר הזה לבין Docmatix?

המאגר הזה לוקח את הדגימות הקיימות מ־Docmatix ומוסיף לטקסט הנחיה מוגדרת. ההנחיה מדריכה את המודל כיצד לתרגם את התמונה ישירות לפורמט המובנה DocTag, מה שהופך אותו למוכן לאימון מודלים מסוג instruction-following.

איך טוענים

הנתונים מחולקים לתוך 1,106 קובצי Parquet, מה שאומר שמדובר בהורדה כבדה ומפוצלת שדורשת עבודה עם הזרמה או אחסון מקומי רחב. אין צורך באישור גישה מיוחד כדי להוריד את הקבצים. בעבודה שוטפת, השדות המרכזיים שמעניינים אתכם הם תמונת המסמך ושדה הטקסט שמכיל את הפרומפט להמרה לצד הפורמט המובנה.

from datasets import load_dataset

ds = load_dataset("HuggingFaceM4/DoclingMatix")

הרישיון

הרישיון הוא cdla-permissive-2.0, רישיון פתוח שמתיר שימוש מסחרי ומאפשר אימון מודלים ללא דרישה לשתף את התוצרים באותו הרישיון. אתם כן נדרשים לשמור על תנאי הייחוס של יוצרי הדאטהסט.

הרישיון המלא ב־Hugging Face ↗