GPT
H

HiDream-I1-Dev

קוד פתוח

HiDream-aimit2025-04-06

  • diffusers
  • safetensors
  • image-generation
  • HiDream.ai
  • text-to-image

מודל תמונה פתוח עם 17 מיליארד פרמטרים שמציג ביצועים מובילים במבחני דיוק פרומפט. הוא מיועד למי שמחפש שליטה מדויקת באובייקטים וביחסים מורכבים בתוך התמונה.

  • 17Bפרמטרים
  • 43.9 GBמשקל הקבצים
  • 259הורדות בחודש
  • 173לייקים

מה זה

מדובר במודל יצירת תמונה מטקסט שמבוסס על ארכיטקטורת Sparse Diffusion Transformer ומכיל מעל 17 מיליארד פרמטרים. לפי מדדי DPG ו־GenEval שפרסמו המפתחים, המודל עוקף חלופות כמו Flux.1-dev, SD3-Medium ו־DALL-E 3, במיוחד בהבנת יחסים בין אובייקטים, צבעים וספירה מדויקת. הוא קיבל ציון של 85.89 במדד DPG ו־0.83 ב־GenEval, לצד תוצאה מובילה במדד העדפת האדם HPS v2.1 במגוון סגנונות כמו צילום, איור וציור.

הייחוד הטכני כאן הוא השימוש בשני מקודדי טקסט כבדים במקביל, T5-XXL של גוגל ו־Llama-3.1-8B-Instruct של מטא, לצד רכיב VAE שנלקח מ־Flux.1 schnell. השילוב הזה נותן למודל יכולת גבוהה לפרק הוראות טקסטואליות מפורטות ולהמיר אותן לתמונה ששומרת על תיאום חזק בין התכונות לבין העצמים הנכונים, נקודת תורפה מוכרת במודלים פתוחים ישנים יותר.

מתאים ל

  • יצירת קומפוזיציות מורכבות

    מתאים לסצנות מרובות עצמים שבהן נדרשת הפרדה חדה בין צבעים, מיקומים וספירת פריטים.

  • פיתוח יישומי עיצוב מסחריים

    בזכות רישיון MIT על הליבה, אפשר לשלב את התוצרים ישירות במוצרים ופרויקטים מסחריים.

  • המחשת רעיונות ואיורים

    ציונים גבוהים במדדי HPSv2.1 מבטיחים תמונות אסתטיות בסגנונות איור, קונספט וצילום ריאליסטי.

איפה זה נופל

למרות הציונים הגבוהים בהבנת רכיבים בודדים, במבחן ה־DPG הגלובלי המודל קיבל ציון נמוך יחסית של 76.44, פחות מ־SDXL הוותיק ומ־DALL-E 3, מה שמעיד על קושי בשמירה על קוהרנטיות של כלל הסצנה ביחס לפרטים הקטנים. בנוסף, המודל מוגדר לשפה האנגלית בלבד. אם תזינו פרומפטים בעברית, סביר להניח שלא תקבלו תוצאות הגיוניות בלי לתרגם קודם. החיבור של כמה רכיבים שונים כמו Llama ו־T5 יוצר תלויות כבדות ומורכבות בהרצה שעלולות להיכשל בהורדה או לחנוק זיכרון במהירות.

שאלות
נפוצות

האם המודל תומך בהוראות טקסט בעברית?

המודל מאומן ומתועד לשפה האנגלית בלבד. מקודד הטקסט של Llama עשוי לזהות עברית באופן בסיסי, אבל החיבור לרכיבי התמונה לא הותאם לכך. בשביל לקבל תוצאות מדויקות, מומלץ לתרגם את הפרומפט לאנגלית לפני השליחה למודל.

איזה כרטיס מסך נדרש כדי להריץ אותו במחשב מקומי?

עם משקל קבצים של כמעט 44 גיגה בייט ומודל שפה של 8 מיליארד פרמטרים שרץ ברקע, כרטיס ביתי רגיל לא יספיק. תצטרכו כרטיס מקצועי עם לפחות 48 או 80 גיגה בייט זיכרון וידאו, יחד עם תמיכה ב־Flash Attention וגרסת CUDA מעודכנת.

איך מריצים

המשקל הכולל של הקבצים עומד על 43.9 גיגה בייט, ובזמן ריצה הסקריפט מוריד גם את המשקלים של Llama 3.1 8B. בשביל להחזיק מודל כזה יחד עם מקודדי הטקסט, דרוש כרטיס מסך ברמה של שרת או תחנת עבודה רצינית עם זיכרון וידאו נדיב מאוד, לצד התקנה של Flash Attention ו־CUDA 12.4.

קוד ההרצה הרשמי מציע שלוש גרסאות: מודל מלא, גרסת dev מזוקקת וגרסת fast מואצת. אם אין לכם גישה לתשתית מקומית חזקה וייעודית, ניסיון להרים את זה לבד יעלה הרבה זמן וכסף, ובמקרים כאלה עדיף לבדוק פתרונות ענן או להשתמש ב־API מנוהל שמחזיק את המודל הזה באוויר.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("HiDream-ai/HiDream-I1-Dev")
img = pipe("a photo").images[0]

הקבצים

36 קבצים במאגר, 43.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד ומודל הטרנספורמר עצמו שוחררו תחת רישיון MIT, שמאפשר שימוש חופשי כולל שימוש מסחרי ומחקר. עם זאת, המודל כולל רכיבים חיצוניים עם רישיונות נפרדים: ה־VAE תחת Apache 2.0, ורכיב הטקסט מבוסס על רישיון הקהילה של Llama 3.1. חובה לוודא שאתם עומדים בכללי השימוש של מטא לפני הפצה במוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗