GPT
F

fine-t2i

קוד פתוח

ma-xuapache-2.02026-01-15

  • text
  • image
  • image-generation
  • t2i
  • image caption

מאגר ענק של מעל שישה מיליון זוגות תמונה וטקסט בנפח של שני טרה. הוא מיועד למי שרוצה לאמן מודלי יצירת תמונה על דאטה שעבר סינון אסתטי קפדני.

  • 16,885הורדות בחודש
  • 120לייקים

מה זה

המאגר מכיל כ־6.15 מיליון תמונות סינתטיות שנוצרו במודלים כמו Z-Image ו־FLUX2, לצד כ־168 אלף תמונות אמיתיות שנאספו מאתרים כמו Unsplash, Pexels ו־Pixabay. לפי החוקרים, מעל 95% מהמועמדים המקוריים נזרקו בתהליך סינון שכלל בדיקות בטיחות, כפילויות סמנטיות, מודל VLM שבדק פגמים ויזואליים, ופילטרים אסתטיים.

התוכן מחולק לפי סוג הפרומפט וצורת התמונה. יש חלקים עם פרומפטים מקוריים וכאלה עם פרומפטים מורחבים, בריבוע או ביחסי צד אקראיים. רוב התמונות ברזולוציה של 1K ומעלה, וכל רשומה מגיעה עם קובץ תמונה, קובץ טקסט שמכיל את התיאור, וקובץ מטא-דאטה.

מתאים ל

  • פיין טיונינג למודלי תמונה

    אימון מודלי דיפוזיה פתוחים על תמונות ברזולוציה גבוהה ופרומפטים מפורטים.

  • אימון כפול לפי סגנון פרומפט

    לימוד מודלים להגיב גם לפרומפטים קצרים של משתמשים וגם לתיאורים ארוכים ומורחבים.

  • מחקר על דאטה סינתטי

    בדיקת ההשפעה של אימון על תמונות שנוצרו במודלים אחרים מול תמונות מצולמות.

איפה זה נופל

הנתונים כולם באנגלית, בלי אף מילה בעברית, כך שלא תוכלו לאמן איתו מודל שמבין הנחיות מקומיות. נקודה קריטית נוספת היא שרובו המוחלט מורכב מתמונות סינתטיות שמודלים אחרים ייצרו. אימון עמוק על דאטה שמיוצר ברובו בידי מכונה יכול לגרור שכפול של עיוותים וסגנונות מובנים של אותם מודלים מקוריים, למרות הסינון שהחוקרים דיווחו עליו.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא Apache 2.0 שמתיר שימוש מסחרי מלא. אתם יכולים לאמן עליו מודל ולשלב אותו במוצר שלכם, כל עוד אתם שומרים על תנאי הקרדיט הנדרשים ברישיון.

כמה שטח אחסון צריך בשביל להוריד אותו?

המאגר כולו תופס מעל שני טרה בייט. אם תרצו רק חלק מסוים, כמו התמונות האמיתיות או תמונות בריבוע, התיקיות מחולקות לפי משקלים של בין 259 ל־517 גיגה בייט.

האם המאגר תומך בעברית?

לא. כל הטקסטים והפרומפטים במאגר הם באנגלית בלבד. אם אתם צריכים מודל שמבין עברית ישירות, תצטרכו לתרגם את הטקסטים בעצמכם או להסתמך על מאגר נוסף.

מה ההבדל בין התמונות הסינתטיות לאמיתיות כאן?

מעל שישה מיליון תמונות יוצרו במודלים Z-Image ו־FLUX2, ועברו סינון אסתטי כדי להסיר עיוותים. התמונות האמיתיות, כ־168 אלף במספר, נאספו ישירות מאתרי צילום כמו Pexels ו־Unsplash.

איך טוענים

המאגר שוקל מעל שני טרה ומאורגן באלפי קובצי tar במבנה WebDataset, כך שהורדה מלאה לדיסק המקומי תהיה כבדה ויקרה. הגישה חופשית לגמרי ואין צורך בבקשת אישור. הדרך ההגיונית לעבוד איתו בספריית datasets היא להפעיל מצב streaming ולהצביע על התיקייה הספציפית שמעניינת אתכם. לכל דוגמה יש קובץ jpg, קובץ txt שמחזיק את הפרומפט וקובץ json עם נתונים נוספים, אבל לאימון רגיל של מודל יצירה מספיקים שני הראשונים.

from datasets import load_dataset

ds = load_dataset("ma-xu/fine-t2i")

הרישיון

המאגר מופץ ברישיון Apache 2.0. הרישיון מתיר שימוש מסחרי ומחקר, ומאפשר לאמן עליו מודלים חופשיים או מסחריים בלי לחייב אתכם לפתוח את הקוד שלכם. התנאי המרכזי הוא מתן קרדיט ושמירה על הודעות זכויות היוצרים של היוצרים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗