GPT
M

monet

קוד פתוח

jasperaiapache-2.02026-04-28

  • text-to-image
  • image-text
  • multimodal
  • captioning
  • synthetic-data

103.8 מיליון זוגות תמונה וטקסט שעברו סינון קפדני מתוך כמעט שלושה מיליארד מקורות. המאגר מגיע עם וקטורים מוכנים, ייצוגי VAE ותיאורים מכמה מודלים כדי לחסוך זמן ומשאבי אימון יקרים.

  • 114,102הורדות בחודש
  • 163לייקים

מה זה

כל רשומה במאגר כוללת תמונה לצד תיאור המקור שלה, לצד עד ארבעה תיאורים סינתטיים שנוצרו על ידי מודלים שונים כדי לתפוס גם מושגים כלליים וגם פרטים דקים. מעבר לטקסט, המפתחים צירפו לכל דוגמה וקטורים של DINOv2, CLIP ו־SSCD, ייצוגי VAE מקודדים מראש, זיהויי אובייקטים ופנים, וציוני איכות ובטיחות. המאגר נבנה כמאגר אימון אחד ללא חלוקה מובנית לולידציה או בדיקה, כך שצריך להקצות דוגמאות כאלה לבד.

הנתונים נאספו מתשעה מקורות פתוחים שונים, מתוכם שישה מבוססים על תמונות רשת כמו LAION, COYO ופליקר, ושלושה מבוססים על דאטה סינתטי ממודלים כמו FLUX ו־Z-Image. תהליך הסינון עבר שרשרת הדוקה שכללה פסילת תמונות ברזולוציה נמוכה מחמש מאות ושתיים עשרה פיקסלים, בדיקות בטיחות וסינון עירום, הסרת כפילויות מדויקות וקרובות באמצעות וקטורי SSCD, וחסימת אתרי תמונות מסחריים וסימני מים.

מתאים ל

  • אימון מודלי דיפוזיה

    שימוש בייצוגי ה־VAE המוכנים לאימון ישיר של מודלי יצירת תמונה מטקסט תוך חיסכון במשאבי עיבוד.

  • אחזור תמונה וטקסט

    בניית מנועי חיפוש מבוססי טקסט או תמונה בעזרת וקטורי ה־CLIP וה־DINOv2 המשובצים ברשומות.

  • סיווג תמונות ללא אימון

    הערכה ובדיקה של מודלים במשימות זיהוי תמונה בשיטת zero shot לפי וקטורי ייצוג קיימים.

איפה זה נופל

המאגר מוגבל לאנגלית בלבד, ואין בו ייצוג לשפות אחרות. מבחינת ייצוג אנושי, בדיקות מדגמיות של היוצרים מראות הטיה ברורה לעולם המערבי, עם ריכוז בגווני עור בינוניים ומיעוט של גוונים בהירים או כהים מאוד, וכן נטייה מובהקת לגילאי בגרות על חשבון ילדים וקשישים. בנוסף, תיאורי התמונות שנוצרו על ידי מודלי שפה כוללים לעיתים הזיות ופרטים שאינם קיימים במציאות, ואינם מכילים תיוגים מבניים של יחסים במרחב. למרות הסינון המוקפד, שום מנגנון אוטומטי אינו חסין לחלוטין מתוכן פוגעני.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצרים מסחריים?

כן, המאגר פורסם תחת רישיון Apache 2.0 שמתיר שימוש מסחרי מלא, כולל אימון מודלים למוצרים סגורים. יש לוודא ששומרים על תנאי הייחוס של הרישיון בתיעוד הפרויקט. כדאי לזכור שמקורות התמונות עצמם נאספו מהרשת, כך שהרישיון מכסה את המאגר אך לא מבטיח פטור מתביעות צד ג על תוכן התמונות.

כמה המאגר שוקל ואיך מומלץ לגשת אליו?

המאגר כולל עשרות אלפי קבצים ומעל מאה מיליון רשומות, כך שהורדת כל התמונות ברזולוציה מלאה דורשת נפח אחסון עצום. מומלץ להתחיל בהזרמת גרסת ה־parquet ששוקלת כחמישית מהנפח המלא ומכילה תמונות ממוזערות יחד עם כל הוקטורים והמטא-דאטה. רק בשלב האימון הסופי כדאי למשוך את קובצי ה־tar הרלוונטיים באמצעות ספריית WebDataset.

האם יש במאגר נתונים בעברית?

לא, המאגר מבוסס על השפה האנגלית בלבד, הן בתיאורי המקור והן בארבעת התיאורים הסינתטיים שנוצרו מחדש. אם המטרה היא לאמן מודל שיבין הנחיות בעברית, תצטרכו לתרגם את התיאורים באופן עצמאי או להשתמש במודל ביניים. הדאטהסט לא כולל שום התאמה מקומית לשפות אחרות.

מה ההבדל בינו לבין LAION או COYO הרגילים?

במקום מאגרי ענק גולמיים ומלאי רעש, כאן בוצע ניקוי של כמעט שלושה מיליארד זוגות תמונה וטקסט לכדי עשרה אחוזים איכותיים בלבד. בנוסף לסינון כפילויות ותמונות מאיכות ירודה, המאגר מוסיף תיאורים מפורטים ממספר מודלי שפה ווקטורים שמחושבים מראש. החבילה כוללת גם ייצוגי VAE מוכנים שחוסכים את שלב הקידוד בזמן אימון של מודלי תמונה.

איך טוענים

טעינת המאגר מתבצעת ישירות דרך Hugging Face בספריית datasets או באמצעות WebDataset לעבודה עם קובצי ה־tar של התמונות המלאות. אין צורך באישור גישה מוקדם כדי להוריד את הקבצים. הדרך היעילה לבחון את המידע היא להשתמש בהגדרת ה־parquet בסטרימינג, שמכילה תמונות ממוזערות של עד שלוש מאות שמונים וארבעה פיקסלים ואת כל המטא-דאטה, הוקטורים והייצוגים, מה שחוסך פי חמישה בנפח לעומת משיכת התמונות המלאות. השדות החשובים לסינון ראשוני הם מקור הנתונים, ציוני הבטיחות והאיכות האסתטית.

from datasets import load_dataset

ds = load_dataset("jasperai/monet")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי, שינוי והפצה, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון. מודלים שמאומנים על הדאטהסט אינם מחויבים להיפתח באותו רישיון ואינם נחשבים נגזרת ישירה שלו. עם זאת, יש לזכור שחלק מהתמונות המקוריות הגיעו ממאגרי רשת מגוונים, ולכן נדרשת זהירות משפטית עצמאית בשימוש בתוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗