GPT
D

DocSynth300K

קוד פתוח

juliozhaoרישיון לא דווח2024-10-17

מאגר נתונים סינתטי ומגוון לאימון מקדים של מודלים לניתוח מבנה מסמכים. הוא מיועד למי שרוצה לשפר זיהוי אלמנטים גרפיים ומבניים לפני כוונון עדין על מסמכים אמיתיים.

  • 531הורדות בחודש
  • 55לייקים

מה זה

המאגר כולל נתונים שמיועדים לאימון מקדים של מודלים לניתוח מבנה של מסמכים, בדגש על מגוון ויזואלי וגודל משמעותי. לפי כרטיס המאגר, הנתונים עצמם שמורים בקובצי parquet שמחולקים למספר חלקים, כמו part0 עד part14, ונועדו לעבור המרה למבנה נתונים שמתאים למודלים מסוג YOLO.

הכרטיס לא מפרט מאיזה מקורות טקסט או תבניות נוצרו המסמכים הסינתטיים, וגם לא מציין אילו קטגוריות ספציפיות מתויגות בכל עמוד. מטרת העל שמתוארת בדף היא שיפור של ביצועי המודל במשימות downstream של חלוקת מסמך לאזורים, כותרות ופסקאות. התיעוד מפנה למאמר מחקרי לקבלת פרטים טכניים נוספים, אך בכרטיס עצמו אין הסבר על תהליך הסינון או החלוקה הפנימית בין החלקים השונים.

מתאים ל

  • אימון מקדים לניתוח מסמכים

    בניית מודל בסיס לזיהוי מבנה של דפים לפני fine tuning על דאטה ייעודי.

  • אימון מודלי YOLO למסמכים

    המרה ישירה לפורמט YOLO באמצעות הסקריפט המצורף להרצה על שמונה כרטיסי מסך.

  • שחזור תוצאות מחקר

    אימות ורפליקציה של תוצאות המאמר 2410.12628 על בסיס הנתונים המקוריים.

איפה זה נופל

הכרטיס לא מדווח על השפות שקיימות בתוך המסמכים, ולכן אי אפשר לדעת אם יש תמיכה בעברית או בטקסט מימין לשמאל בלי להוריד את הקבצים ולבדוק אותם ידנית. בנוסף, חסר פירוט על המחלקות המדויקות שסומנו ועל הרכב הדאטה, מה שמקשה להעריך הטיות גרפיות בלי לקרוא את המאמר הנלווה. מדובר בנתונים סינתטיים שנבנו לאימון מקדים, כך שלפני שילוב במוצר תצטרכו לאמת את הביצועים מול מסמכים אמיתיים שמשקפים את הצרכים שלכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא מומלץ כרגע, כי לא דווח רישיון בעמוד הדאטהסט. בהיעדר רישיון פתוח מפורש, אין הרשאה חוקית להשתמש בנתונים או בנגזרות שלהם למוצרים מסחריים.

כמה שטח אחסון צריך לפנות להורדה?

לפי ההנחיות בכרטיס, המאגר שוקל כ־113 גיגה בייט. תצטרכו שטח נוסף לצורך המרת קובצי ה־parquet למבנה התיקיות של YOLO.

האם הדאטהסט כולל תמיכה במסמכים בעברית?

הכרטיס לא מציין אילו שפות קיימות במסמכים הסינתטיים. לא כדאי להניח שיש שם עברית או תמיכה בטקסט מימין לשמאל בלי לדגום את הנתונים בפועל.

איך מחלצים את הנתונים מתוך קובצי ה־parquet?

היוצרים מספקים סקריפט פייתון בשם format_docsynth300k.py. הסקריפט מעבד את 32 הקבצים וממיר אותם לפורמט מתאים לעבודה עם ארכיטקטורת YOLO.

איך טוענים

המאגר שוקל כ־113 גיגה בייט ומחולק לקובצי parquet. ההורדה מתבצעת בעזרת snapshot_download של huggingface_hub ישירות לתיקייה מקומית, ואין צורך בבקשת אישור גישה מראש. כדי להשתמש בנתונים לאימון ב־YOLO, הכרטיס מנחה להריץ סקריפט המרה ייעודי בשם format_docsynth300k.py. היוצרים ממליצים על סביבה של שמונה מעבדים גרפיים, ומזהירים מדליפת זיכרון בקוד הטעינה המקורי של YOLO שעלולה לעצור את התהליך, כך שיש לשמור נקודות ביקורת ולהמשיך מהן.

from datasets import load_dataset

ds = load_dataset("juliozhao/DocSynth300K")

הרישיון

היוצר לא הגדיר רישיון במאגר. מבחינה משפטית, כשאין רישיון מוצהר זכויות היוצרים שמורות ליוצר, ולא ניתנת רשות מפורשת להשתמש בנתונים, להפיץ אותם או לבנות עליהם מודלים לשימוש מסחרי. חברות וצוותי פיתוח צריכים לקחת בחשבון שמצב כזה חושף אותם לסיכון משפטי, אלא אם יפנו ישירות ליוצר ויקבלו אישור כתוב.

הרישיון המלא ב־Hugging Face ↗