GPT
T

TextAtlas5M

קוד פתוח

CSU-JPGmit2025-02-11

מאגר ענק שמיועד לפתור את אחת הבעיות הקשות במודלי תמונה, יצירת טקסט קריא וצפוף בתוך התמונה עצמה. מי שמאמן מודלי יצירת תמונה מבוססי טקסט ימצא פה מגוון רחב של שילובי תוכן גרפי ומלל.

  • 5,472הורדות בחודש
  • 39לייקים

מה זה

המאגר כולל בין מיליון לעשרה מיליון רשומות שמחולקות לעשרה תתי-מאגרים שונים. המבנה של כל רשומה פשוט מאוד ומכיל שלושה שדות בלבד: תמונת המקור, מחרוזת של פרומפט הקלט ששימש ליצירת הטקסט, ושם קובץ התמונה. החלוקה הפנימית מציגה סוגים מגוונים של שילובי טקסט וויזואליה, כולל מצגות מפורטות ומובנות, שילובים של טקסטים ארוכים, כריכות ספרים, מאמרים, טקסט מסוגנן וסצנות ריאליסטיות באיכות גבוהה.

הכרטיס לא מפרט את אופן הסינון של הדוגמאות או את מקור התמונות המדויק מעבר לשמות החלקים, אבל שמות התת-מאגרים כמו CleanTextSynth ו־StyledTextSynth מעידים על שילוב של מידע סינתטי לצד תוכן כמו מאמרים ומצגות. הנתונים מאורגנים לפי נושאים אלה כדי לאפשר אימון ממוקד על סגנון ויזואלי מסוים או על צפיפויות שונות של מלל באנגלית.

מתאים ל

  • אימון מודלי תמונה

    שיפור היכולת של מודלי תמונה לייצר פסקאות ומילים קריאות באנגלית בתוך התמונה.

  • יצירת מצגות ומסמכים

    אימון מודלים להפקת פריסות גרפיות מורכבות של שקפים וכריכות ספרים עם כיתוב.

  • הערכת ביצועי מודלים

    מדידת הדיוק והקריאות של טקסט שנוצר על ידי מודלי תמונה מול נתוני המקור.

איפה זה נופל

המאגר מוגדר רשמית לשפה האנגלית בלבד, כך שאינו מספק מענה ליצירת טקסט בעברית או בשפות אחרות. מעבר לכך, הכרטיס אינו מפרט סינוני רעילות, הטיות חברתיות, או את מקורות התמונות המדויקים, ולכן קשה לדעת אם קיימות הפרות זכויות יוצרים בתוכן המקור של המצגות והספרים ללא בדיקה מעמיקה של הפלט.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, המאגר פורסם תחת רישיון mit שאינו מגביל שימוש מסחרי. ניתן לאמן עליו מודלים שמיועדים למכירה או להטמעה במוצרים עסקיים, כל עוד מצרפים את תנאי הרישיון המקוריים.

האם יש בדאטהסט תמיכה בעברית?

לא, המאגר מוגדר רשמית עבור השפה האנגלית בלבד. אם המטרה היא לאמן מודל שיודע לכתוב אותיות עבריות בצורה קריאה על גבי תמונות, המאגר הזה לא יספק את הדוגמאות הדרושות לכך.

איך מורידים חלק ספציפי בלי להוריד את כל הדאטהסט?

הורדה מתבצעת לפי תתי-מאגרים באמצעות ציון השם הרלוונטי בפונקציה load_dataset. למשל, אפשר לציין את CoverBook או PPT2Details כדי למשוך רק את הקבצים השייכים לאותו חלק ולחסוך מקום באחסון.

מה המבנה של כל דוגמה בתוך הקבצים?

כל רשומה בקובצי ה־parquet מכילה שלושה שדות: התמונה עצמה בפורמט ויזואלי, הפרומפט שמתאר את הטקסט, ושם הקובץ המקורי. המבנה הזה פשוט ומינימלי, ללא מטא-דאטה מורכב על גופנים או מיקומים מדויקים.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות הפקודה load_dataset, כאשר חובה להגדיר תת-מאגר ספציפי כמו CleanTextSynth או TextScenesHQ. המאגר פתוח לציבור ללא צורך באישור גישה מראש. הוא שמור ב־602 קובצי parquet, כך שהורדה שלמה דורשת נפח אחסון משמעותי וחיבור רשת יציב, במיוחד אם מורידים כמה תתי-מאגרים במקביל.

from datasets import load_dataset

ds = load_dataset("CSU-JPG/TextAtlas5M")

הרישיון

המאגר מופץ תחת רישיון mit. מדובר ברישיון מתירני שמאפשר שימוש מסחרי, מחקרי, שינוי והפצה, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי. המשמעות היא שניתן לאמן עליו מודלים מסחריים בחופשיות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗