GPT
H

HiDream-E1-Full

קוד פתוח

HiDream-aimit2025-04-27

  • diffusers
  • safetensors
  • image-editing
  • HiDream.ai
  • any-to-any

המודל הזה עורך תמונות לפי הוראות טקסט ישירות, ומציג תוצאות גבוהות במבחני שינוי סגנון וצבע. מי שמחפש עריכת תמונה פתוחה עם שילוב מודלי שפה חזקים ימצא בו עניין.

  • 17Bפרמטרים
  • 44.2 GBמשקל הקבצים
  • 258הורדות בחודש
  • 216לייקים

מה זה

המודל נשען על בסיס HiDream-I1 ומתמקד בעריכת תמונות מונחית הוראות. הוא משלב מפענחי טקסט כבדים כמו Llama-3.1-8B ו־T5-XXL לצד רכיבי VAE של FLUX.1 schnell, כדי להבין בקשות עריכה מורכבות ולבצע אותן בלי להרוס את שאר התמונה.

במדדי EmuEdit ו־ReasonEdit הוא עוקף מודלים כמו Gemini-2.0-Flash ו־OmniGen בציון הממוצע, במיוחד במשימות של שינוי סגנון, התאמת צבעים ושינוי טקסט בתוך תמונה. המשמעות היא שרמת הדיוק שלו בפעולות עריכה ממוקדות גבוהה מאוד לעומת המתחרים בקטגוריה, אם כי בהוספת אובייקטים חדשים ג'מיני עדיין מוביל עליו במספרים.

מתאים ל

  • שינוי סגנון אומנותי

    הוא השיג ציון של 6.49 במדד EmuEdit Style, מה שהופך אותו למתאים להמרת תמונות קיימות לסגנונות איור וציור.

  • תיקוני צבע ואווירה

    עם ציון 7.57 בקטגוריית הצבע, הוא מתמודד בהצלחה עם שינויי גוונים מדויקים של אלמנטים בלי לפגוע בפרטים.

  • עריכת טקסט בתמונה

    התוצאות שלו ב־EmuEdit Text גבוהות מהמתחרים, ולכן הוא מתאים להחלפה או התאמה של כיתובים קיימים בתמונות באנגלית.

איפה זה נופל

המודל דורש פורמט קלט קשיח שכולל גם את הוראת העריכה וגם תיאור של תמונת היעד, מה שמאלץ שימוש בסקריפט חיצוני עם מפתח VLM או חיבור ל־OpenAI כדי להגיע לתוצאות טובות. הוא תומך באנגלית בלבד ואינו מכיר עברית. במבחני הוספת אובייקטים ושינוי רקע הוא מציג ביצועים נמוכים יותר לעומת חלופות קנייניות, ויש כבר גרסה מעודכנת בשם E1.1 שיצאה אחריו.

שאלות
נפוצות

האם אפשר לשלוח לו פרומפט קצר ופשוט לעריכה?

עדיף שלא. המודל בנוי לקבל מבנה מוגדר שמורכב מהוראת העריכה ותיאור מפורט של תמונת היעד. כדי לעשות את זה נכון, המפתחים מספקים סקריפט חידוד שמשתמש במודל ראייה חיצוני דרך API או הרצה מקומית.

האם אפשר להריץ אותו על כרטיס מסך ביתי רגיל?

לא. משקל המודל לבדו חוצה את ה־44 גיגה בייט, ובנוסף תהליך ההרצה מושך את Llama-3.1-8B לזיכרון. תצטרכו חומרה ברמת שרתים או כרטיסי מסך מקצועיים עם נפח זיכרון וידאו נרחב מאוד.

איך מריצים

כדי להריץ אותו צריך סביבת לינוקס עם CUDA 12.4, גרסה מעודכנת של ספריית diffusers והתקנה של Flash Attention. מדובר במפלצת של 17 מיליארד פרמטרים וקבצים במשקל של מעל 44 גיגה בייט, שמורידה בנוסף גם את לאמה 8B, כך שצריך כרטיס מסך חזק מאוד עם נפח זיכרון ייעודי גדול כדי שהתהליך ירוץ בלי לקרוס.

בנוסף, סקריפט ההרצה דורש גישה מאושרת לחשבון Hugging Face עבור Llama-3.1-8B-Instruct. אם אין לכם חומרה כבדה וזמינה בענן או מקומית, עדיף לפנות לממשקי API חיצוניים כמו vivago.ai או להריץ מודל VLM נפרד לחידוד הפרומפטים.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("HiDream-ai/HiDream-E1-Full")
img = pipe("a photo").images[0]

הקבצים

37 קבצים במאגר, 44.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

החלקים המרכזיים של הטרנספורמר משוחררים תחת רישיון MIT שמאפשר שימוש מסחרי, אבל המערכת תלויה ישירות ברכיבים חיצוניים ברישיונות אחרים. ה־VAE מגיע תחת Apache 2.0, ומפענח הטקסט כפוף לרישיון הקהילתי של Llama 3.1. מותר להשתמש בתוצרים באופן חופשי, אך יש לוודא עמידה במגבלות השימוש של מטא ואיסור על הפקת תוכן לא חוקי או פוגעני.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗