GPT
T

text-to-image-2M

קוד פתוח

jackyhatemit2024-09-11

המאגר מרכז כשני מיליון זוגות של תמונה וטקסט שנועדו לכוונון עדין של מודלי יצירת תמונה. הוא פותר בעיות של חוסר גיוון ואיכות ירודה שקיימות במאגרי הבנה כלליים.

  • 2,211הורדות בחודש
  • 172לייקים

מה זה

המאגר מחולק לשני חלקים עיקריים ומבוסס על שילוב של מספר מקורות קיימים. החלק המרכזי כולל כשני מיליון דוגמאות ברזולוציה של 512 על 512 פיקסלים. הוא מורכב מכ־700 אלף רשומות מתוך LLaVA-next שתוארו מחדש באמצעות המודל Qwen2-VL, כ־500 אלף פרומפטים מ־LLaVA-pretrain שתמונותיהם נוצרו באמצעות Flux-dev, כ־900 אלף דוגמאות סינתטיות של DALL-E 3 שעברו סינון וחיתוך למרכז, ועוד 100 אלף רשומות שנוצרו במלואן על ידי GPT-4o ו־Flux-dev.

החלק השני קטן בהרבה ומכיל 10,000 דוגמאות ברזולוציה של 1024 על 1024 פיקסלים. חלק זה מיועד להתאמה לרזולוציה גבוהה, ומורכב כולו מפרומפטים שנכתבו על ידי GPT-4o ותמונות שנוצרו במודל Flux-dev.

מתאים ל

  • כוונון מודלי תמונה

    אימון משלים למודלי דיפוזיה על שני מיליון זוגות מפוקחים ברזולוציית 512 פיקסלים.

  • התאמה לרזולוציה גבוהה

    שימוש בתת המאגר של עשרת אלפים הרשומות לשיפור יצירה בגודל 1024 על 1024 פיקסלים.

  • אימון כתוביות לתמונה

    הערכה ואימון של מודלי ראייה שמפיקים תיאורי טקסט מפורטים מתוך תמונות קיימות.

איפה זה נופל

חלק גדול מאוד מהמאגר מורכב מתמונות סינתטיות שנוצרו על ידי Flux-dev ו־DALL-E 3, ולא מתמונות מהעולם האמיתי. הטקסטים כולם באנגלית, ללא ייצוג לשפות אחרות או לעברית, וחלקם נכתבו על ידי מודלים כמו GPT-4o ו־Qwen2-VL. המשמעות היא שהמודל שלכם עלול ללמוד הטיות ספציפיות וסגנון ויזואלי של מודלי המקור. בנוסף, רזולוציית הבסיס של רוב המאגר מוגבלת ל־512 פיקסלים בלבד.

שאלות
נפוצות

האם המאגר כולל תמיכה בעברית?

לא. כל התיאורים והפרומפטים במאגר נכתבו באנגלית בלבד. אם המטרה היא לאמן מודל שמבין עברית ישירות, תצטרכו לתרגם את הטקסטים או להשתמש בנתונים נוספים.

מאיפה הגיעו התמונות במאגר?

התמונות מגיעות משילוב של צילומים קיימים ממאגר LLaVA-next לצד תמונות סינתטיות רבות שנוצרו במודלים Flux-dev ו־DALL-E 3. חלק מהתיאורים המקוריים הוחלפו בתיאורים מפורטים של מודלים כמו Qwen2-VL ו־GPT-4o.

האם חייבים להוריד את כל הקבצים מראש?

לא. הנתונים שמורים במבנה WebDataset של קבצי tar, ואפשר להזרים אותם ישירות בזמן הריצה באמצעות ספריית datasets. זה מונע את הצורך בנפח אחסון מקומי עצום לפני שמתחילים לבדוק את החומר.

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

הרישיון המדווח של המאגר הוא MIT, שמתיר שימוש מסחרי חופשי כל עוד שומרים על הודעת זכויות היוצרים. יחד עם זאת, חלק מהתמונות נוצרו במודלים חיצוניים כמו Flux-dev, ולכן מומלץ לוודא שתנאי השימוש של אותם מודלים מקוריים מתאימים לצרכים שלכם.

איך טוענים

הנתונים ארוזים בפורמט WebDataset כקבצי tar מחולקים. טוענים אותם באמצעות ספריית datasets עם תמיכה בהזרמה ישירה, כך שאין חובה להוריד את כל עשרות הקבצים מראש לדיסק המקומי. אין צורך באישור גישה מיוחד כדי להתחיל למשוך את הדגימות, והעבודה נעשית מול קישורי ה־URL של הקבצים ישירות מהמאגר.

from datasets import load_dataset

ds = load_dataset("jackyhate/text-to-image-2M")

הרישיון

המאגר מפורסם תחת רישיון MIT, שמתיר שימוש מסחרי, שינוי והפצה ללא דרישה לשיתוף תחת אותו רישיון. נדרש רק לתת ייחוס ליוצרים המקוריים. אפשר לאמן מודלים על הנתונים הללו ולהשתמש בתוצרים באופן מסחרי, בכפוף לתנאי הרישיון הבסיסיים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗