GPT
H

HiDream-E1-1

קוד פתוח

HiDream-aimit2025-07-16

  • diffusers
  • safetensors
  • image-editing
  • HiDream.ai
  • any-to-any

מודל עריכת תמונות שמיועד למי שצריך לבצע שינויים מורכבים לפי הוראות טקסט, בלי לעבור דרך שירותי ענן סגורים. הוא נשען על שילוב מודלי שפה כבדים כדי להבין בקשות עריכה מפורטות.

  • 17Bפרמטרים
  • 43.9 GBמשקל הקבצים
  • 81הורדות בחודש
  • 217לייקים

מה זה

מדובר במודל עריכת תמונות מבוסס דיפוזיה שנבנה על גבי HiDream-I1, ומתמקד בביצוע שינויים מונחי טקסט בתמונות קיימות. הוא לא מייצר סתם תמונה מאפס אלא יודע להוסיף עצמים, להסיר אלמנטים, להחליף רקעים, לשנות צבעים ולהתאים סגנונות לפי הוראות מפורשות באנגלית. הארכיטקטורה שלו נשענת על מפענחי טקסט כבדים מאוד, כולל שימוש במודל שפה של שמונה מיליארד פרמטרים לצד מקודדים נוספים, כדי לקלוט הנחיות עריכה עם לוגיקה מורכבת.

במדדי הביצועים שהמפתחים הציגו, כמו EmuEdit ו־ReasonEdit, הגרסה הזו מציגה ציונים גבוהים יותר מכלים אחרים שנבדקו מולה, כולל Gemini-2.0-Flash ומודלים פתוחים כמו OmniGen ו־UltraEdit. במבחן EmuEdit הוא מגיע לממוצע של 7.57 לעומת 5.99 של ג'מיני, עם קפיצה משמעותית בעריכות גלובליות, החלפת רקעים ודיוק בהסרת פריטים. במדד ReasonEdit הוא קיבל 7.70, מה שמראה יכולת טובה יותר להבין הוראות עריכה שדורשות הבנה של ההקשר בתמונה ולא רק פקודות פשוטות.

מתאים ל

  • עריכת תמונות לפי פקודות

    מתאים לביצוע שינויים מדויקים כמו החלפת רקע, צבע או הוספת פריט בתמונה לפי תיאור טקסטואלי מורכב.

  • עיבוד תמונות למסחר אלקטרוני

    מאפשר לשנות סגנון או להחליף אלמנטים בתמונות מוצר קיימות בקוד פתוח במקום לשלם על ממשקי ענן סגורים.

  • הסרת עצמים מורכבת

    מיועד למקרים שבהם מחיקת פריט דורשת הבנה של ההקשר בתמונה כדי להשלים את הרקע בצורה שתואמת את המקור.

איפה זה נופל

המגבלה המרכזית היא התלות המוחלטת ברכיבים חיצוניים כבדים כדי לפעול. סקריפט ההרצה דורש חיבור והורדה של מודל חיצוני של מטה, כך שאי אפשר פשוט לפרוס אותו בסביבה מבודדת בלי אישורים והגדרות מוקדמות. בנוסף, המודל מתועד לעבודה בשפה האנגלית בלבד, כך שהוראות בעברית כנראה לא יניבו שום תוצאה סבירה בלי תרגום מוקדם. צריכת המשאבים שלו קיצונית בגלל ריבוי המקודדים, מה שיוצר זמני תגובה ארוכים יחסית ומקשה על שילוב שלו במערכות שדורשות מענה מהיר למשתמש.

שאלות
נפוצות

האם המודל תומך בהנחיות עריכה בעברית?

הכרטיס מציין תמיכה בשפה האנגלית בלבד. מקודדי הטקסט אומנם מבוססים על Llama ו־T5, אבל כל הבדיקות והאימונים התמקדו באנגלית, ולכן הנחיות בעברית יובילו לפספוסים או לתוצאות גרועות. מומלץ לתרגם את ההוראות לאנגלית לפני השליחה למודל.

מה צריך כדי להריץ את סקריפט הניסוי המקומי?

מעבר להתקנת ספריות כמו Flash Attention ו־diffusers, אתם חייבים חשבון פעיל ב־HuggingFace שאושר לשימוש ברישיון של Llama 3.1. בזמן ההרצה הסקריפט מתחבר לחשבון שלכם כדי למשוך את קובצי המודל של מטה, ובלי ההרשאה הזו הריצה תיכשל מיד.

איך מריצים

כדי להריץ אותו צריך להוריד כמעט ארבעים וארבעה גיגה בייט של קבצים, שזה רק המשקלים של המודל עצמו. בזמן הריצה הסקריפט מושך אוטומטית גם את Llama-3.1-8B-Instruct, ולכן חייבים חיבור פעיל לחשבון שלכם עם אישור רישיון מול מטה. ההרצה דורשת סביבת לינוקס עם CUDA 12.4, התקנה ידנית של Flash Attention והגרסה העדכנית ביותר של diffusers ישירות מהמאגר.

עם שבעה עשר מיליארד פרמטרים של המודל ועוד מקודדי טקסט של Llama ו־T5 XXL, אי אפשר להריץ את זה על חומרה ביתית רגילה. אתם חייבים מאיץ גרפי חזק ברמת מרכזי נתונים עם זיכרון וידאו נרחב מאוד כדי להחזיק את כל החלקים בזיכרון. אם המטרה היא רק בדיקה מהירה או שאין לכם שרת ייעודי כזה, אין טעם להסתבך עם התקנה מקומית ועדיף לפנות לשירות הענן של החברה שמציע הדגמה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("HiDream-ai/HiDream-E1-1")
img = pipe("a photo").images[0]

הקבצים

36 קבצים במאגר, 43.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד ומשקלי הטרנספורמר שפורסמו כאן מוגדרים תחת רישיון MIT שמאפשר שימוש מסחרי, שינוי והפצה בלי תמלוגים. יחד עם זאת, הפתרון כולו מורכב מחיבור של רכיבים עם רישיונות נפרדים: מקודד הווידאו מגיע מ־FLUX תחת Apache 2.0, מקודד T5 הוא ברישיון Apache 2.0, ומודל השפה כפוף לרישיון הקהילה של Llama 3.1. בגלל השילוב הזה, שימוש מסחרי במוצר מחייב עמידה בכל תנאי הרישיון של מטה במקביל.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗