GPT
H

HiDream-I1-Full

קוד פתוח

HiDream-aimit2025-04-06

  • diffusers
  • safetensors
  • image-generation
  • HiDream.ai
  • text-to-image

מודל תמונה פתוח עם 17 מיליארד פרמטרים ברישיון MIT. הוא פונה למי שרוצה דיוק קיצוני בהבנת פרומפטים מורכבים ומוכן לשלם על זה בחומרה כבדה.

  • 17Bפרמטרים
  • 43.9 GBמשקל הקבצים
  • 710הורדות בחודש
  • 997לייקים

מה זה

מדובר במודל יצירת תמונה מטקסט שמבוסס על ארכיטקטורת Sparse Diffusion Transformer. המטרה העיקרית שלו היא לפתור נקודות תורפה קלאסיות של מחוללי תמונות, כמו הבדלה בין שני אובייקטים באותה סצנה, התאמת צבעים נכונה לכל פריט, וספירה של אלמנטים. בשביל זה הוא לא מסתמך על מקודד טקסט פשוט, אלא מחבר בין המקודד של גוגל לבין מודל שפה שלם של מטא כדי לפרק הוראות ארוכות ומסובכות.

במבחני GenEval הוא עוקף את פלוקס ודאלי 3 ומגיע לציון כללי של 0.83, עם דיוק גבוה במיוחד בספירה של עצמים ומיקום שלהם בפריים. גם במדד HPS שבודק העדפה אנושית הוא מוביל מול שאר המודלים הפתוחים. בפועל, זה אומר שהוא מייצר תמונות שנראות פחות סינתטיות ומפספס הרבה פחות פריטים שביקשתם בטקסט, בעיקר כשמדובר בסגנונות כמו איור, ציור או צילום ריאליסטי.

מתאים ל

  • הפקת איורים מרובי דמויות

    שומר על הפרדה נכונה בין שני אובייקטים והתאמת צבעים מדויקת לפי התוצאות במבחן GenEval.

  • יצירת נכסים חזותיים למשחקים

    מציג ציונים גבוהים במיוחד בסגנונות קונספט-ארט וציור בהשוואה למודלים פתוחים אחרים.

  • מערכות עיצוב עם הנחיות מדויקות

    מתאים לתרחישים שדורשים ספירה נכונה של פריטים ומיקום מדויק של עצמים בתוך הפריים.

איפה זה נופל

למרות ההצלחה בפרטים הקטנים, בבדיקת DPG-Bench הוא קיבל ציון נמוך יחסית של 76.44 בהבנה גלובלית, לעומת מעל 85 אצל מודלים מקבילים. המשמעות היא שלפעמים הוא מתרכז מדי באובייקטים הבודדים ומפספס את הקומפוזיציה הכללית של התמונה. בנוסף, הוא מוגבל רשמית לאנגלית בלבד, כך שפרומפטים בעברית ידרשו תרגום מוקדם. יש כאן גם תלות ברשת חיצונית, כי הסקריפט מושך קבצים נוספים של מטא בזמן ההרצה.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב נייד או כרטיס ביתי פשוט?

לא. הקבצים תופסים קרוב ל־44 גיגה ודורשים גם מודל שפה של שמונה מיליארד פרמטרים ברקע. צריך כרטיס מקצועי עם נפח זיכרון עצום וספריית Flash Attention מותקנת.

האם הוא תומך בפרומפטים בעברית?

המודל אומן ותועד עבור אנגלית בלבד. אם תזינו עברית הוא כנראה ייכשל או ייתן תוצאות לא צפויות, ולכן חובה לתרגם את הפרומפט לאנגלית לפני השליחה.

במה גרסת Full שונה מגרסאות dev או fast?

גרסת Full כוללת את כל 17 מיליארד הפרמטרים ונותנת את איכות התמונה המרבית. גרסאות dev ו־fast הן גרסאות מזוקקות שרצות בפחות צעדים ומיועדות למי שחייב מהירות תגובה.

איך מריצים

כדי להריץ את גרסת ה־Full המקומית תצטרכו מפלצת של חומרה. המשקלים לבדם שוקלים כמעט 44 גיגה, וזמן הריצה דורש גם טעינה של מקודד Llama 3.1 8B, כך שכרטיס מסך ביתי רגיל לא יספיק פה וצריך שרת עם כרטיסי A100 או H100 והתקנה ידנית של Flash Attention תחת CUDA 12.4.

בסקריפטים קיימות גם גרסאות מזוקקות בשם dev ו־fast, שנועדו לקצר זמני הפקה. אם אין לכם תשתית ענן ייעודית ותקציב שרתים קבוע, אין שום היגיון כלכלי לתחזק מודל כזה לבד רק בשביל כמה עשרות תמונות ביום.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("HiDream-ai/HiDream-I1-Full")
img = pipe("a photo").images[0]

הקבצים

36 קבצים במאגר, 43.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הטרנספורמר עצמו משוחרר תחת רישיון MIT שמאפשר שימוש מסחרי, שינוי והפצה חופשית. עם זאת, רכיב ה־VAE מגיע מפלוקס ונמצא תחת Apache 2.0, ומקודד השפה כפוף לרישיון הקהילתי של Llama 3.1. כל עוד אתם עומדים בכללי השימוש של מטא ולא מייצרים תוכן פוגעני, התמונות שנוצרות שייכות לכם ואפשר לשלב אותן במוצרים מסחריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗