GPT
U

UniWorld-V1

קוד פתוח

LanguageBindmit2025-05-21

מאגר ענק המאחד מיליוני תמונות והוראות למשימות יצירה, עריכה, מדידה וירטואלית והבנה חזותית. הוא מרכז עשרות מקורות שונים במטרה לאמן מודלים רב תכליתיים ברזולוציה גבוהה.

  • 3,769הורדות בחודש
  • 25לייקים

מה זה

המאגר מחולק לארבע קטגוריות מרכזיות שמכסות קשת רחבה של משימות מולטימודליות. עבור יצירת תמונה מטקסט ישנם נתונים ממאגרים כמו BLIP3o לצד מאגר OSP1024, שבו התיאורים נכתבו מחדש באמצעות Qwen2-VL-72B תוך סינון לתמונות בעלות ציון אסתטי של שש ומעלה וצלע קצרה של לפחות 1024 פיקסלים. תחום עריכת התמונה כולל מאגרים כמו ImgEdit שסונן בחציו בעזרת GPT-4o, וכן OmniEdit ו־SEED שבהם נחתכו החוצה עריכות שכיסו פחות מאחוז בודד משטח התמונה.

חלק נוסף מתמקד במדידה וירטואלית וחילוץ מוצרים על בסיס נתונים מ־VITON-HD, DeepFashion ו־shop_product, שעובדו למבנה של מילוי הוראות. לבסוף, משימות תפיסה חזותית מבוססות על נגזרות של MSCOCO ומקורות נוספים, שכוללות מיפוי דו כיווני לקווי קנטור, מפות עומק, תנוחות שלד, סגמנטציה ושרטוטים.

מתאים ל

  • אימון מודל עריכת תמונות

    לימוד שינוי מונחה טקסט של אזורים בתמונה על בסיס מאות אלפי דוגמאות עריכה מסוננות.

  • פיתוח מדידה וירטואלית

    אימון מערכות הלבשה והחלפת בגדים על אנשים מתוך נתוני VITON-HD ו־DeepFashion.

  • התניית יצירה במפות בקרה

    אימון מודלי ControlNet לייצור תמונות על בסיס קווי קנטור, מפות עומק ושלדי תנוחה.

איפה זה נופל

חלקים מסוימים במאגר לא עברו בקרת איכות כלל, והיוצרים מציינים במפורש כי תת המאגר Ghibli המכיל 36 אלף דוגמאות לא סונן לאיכות. מעבר לכך, כל הטקסטים וההוראות הם באנגלית, ואיכות התיאורים תלויה בדיוק של מודלים אוטומטיים כמו Qwen2-VL ו־GPT-4o, שעלולים לפספס פרטים קטנים או להכניס הזיות. בנוסף, חיתוך גס של שינויים הקטנים מאחוז אחד משטח התמונה עלול למנוע מהמודל ללמוד עריכות עדינות וממוקדות.

שאלות
נפוצות

האם מותר להשתמש במאגר למטרות מסחריות?

הרישיון המוצהר בדף המאגר הוא MIT, שמתיר שימוש מסחרי ללא מגבלות מעבר לשמירת הקרדיט. למרות זאת, המאגר מאגד דאטהסטים חיצוניים רבים כמו JourneyDB ו־MSCOCO, ולכן נדרש לבדוק את תנאי המקור של כל חלק לפני הטמעה במוצר מסחרי.

כמה שטח דיסק נדרש כדי להוריד את הכל?

הורדת המאגר במלואו דורשת נפח של מעל שלושה טרה-בייט וחצי. רק תיקיית ImgEdit צורכת 2.8TB, ורכיבים נוספים כמו OSP1024 ו־Ghibli תופסים יחד כמעט חצי טרה נוסף.

האם יש במאגר תמיכה בעברית?

לא, הנתונים וההוראות במאגר מנוסחים באנגלית בלבד. אם המטרה היא עבודה בעברית, תצטרכו לתרגם את קובצי ה־JSON או לאמן שכבת התאמה לשפה מראש.

כיצד נאספו וסוננו הנתונים למאגר?

היוצרים ליקטו דאטהסטים קיימים ממחקרים שונים ועיבדו אותם מחדש בעזרת מודלי שפה וראייה. הם הפעילו סינונים מבוססי ציון אסתטי, רזולוציית מינימום של 1024 פיקסלים, והסירו עריכות שכיסו פחות מאחוז בודד משטח התמונה.

איך טוענים

המאגר מורכב מ־274 קבצים, רובם ארכיוני tar כבדים של תמונות מקור לצד קובצי אנוטציה בפורמט JSON. הגישה חופשית ואינה דורשת אישור מראש, אך נדרש שטח אחסון של כמה טרה-בייט כדי להוריד את המכלול המלא, כאשר רק ImgEdit לבדו תופס 2.8TB. כדי להשתמש במידע בפועל בונים קובץ הגדרות בשם data.txt עם שלושה נתונים לכל שורה: נתיב לספריית התמונות, נתיב לקובץ ה־JSON המתאים, ודגל בוליאני שמציין אם להפעיל שקלול אזורי, תכונה שהיוצרים ממליצים להדליק על נתוני עריכה ולכבות באחרים.

from datasets import load_dataset

ds = load_dataset("LanguageBind/UniWorld-V1")

הרישיון

המאגר משוחרר ברישיון MIT המאפשר שימוש חופשי, כולל שינוי, הפצה ומסחור של המודלים המאומנים, בכפוף למתן קרדיט ושמירת הודעת הרישיון. עם זאת, המאגר הוא אוסף של עשרות מקורות חיצוניים כמו JourneyDB ו־OpenImages, כך שלפני שימוש מסחרי בפועל חובה לוודא שרישיונות המקור של כל תת מאגר אינם סותרים זאת ומגבילים שימוש כזה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗