GPT
H

HiDream-I1-Fast

קוד פתוח

HiDream-aimit2025-04-06

  • diffusers
  • safetensors
  • image-generation
  • HiDream.ai
  • text-to-image

מודל תמונה מבוסס דיפוזיה שמכוון לייצור מהיר במיוחד, עם ביצועים גבוהים בהבנת טקסט מורכב. הוא מתאים למי שרוצה חלופה פתוחה לכלים קנייניים בלי להתפשר על דיוק בפרטים.

  • 17Bפרמטרים
  • 43.9 GBמשקל הקבצים
  • 85,611הורדות בחודש
  • 107לייקים

מה זה

המודל הזה מחזיק 17 מיליארד פרמטרים ומבוסס על ארכיטקטורת Sparse Diffusion Transformer. המטרה של גרסת ה־Fast היא לייצר תמונות תוך שניות בודדות דרך תהליך זיכוך (distillation), מבלי לשרוף את כל כוח החישוב שדורש מודל הבסיס המלא.

במדדים שפורסמו הוא מציג מספרים מרשימים מול מודלים מובילים אחרים. במבחן DPG-Bench הוא עוקף את Flux.1-dev ואת DALL-E 3 עם ציון כולל של 85.89, בעיקר בזכות יתרון ברור ביחסים בין אובייקטים. במבחן GenEval הוא קיבל 0.83 לעומת 0.66 של Flux.1-dev, מה שמלמד על יכולת יוצאת דופן להציב אובייקטים מרובים ולדייק בצבעים שלהם בדיוק כפי שהוגדר בפרומפט.

מתאים ל

  • יצירת תמונות מורכבות מסחרית

    מתאים למוצרים שדורשים רישיון MIT פתוח יחד עם הצבה מדויקת של מספר אלמנטים שונים באותו הפריים.

  • עיבוד מהיר של בקשות משתמש

    גרסת ה־Fast מותאמת לייצור תוך שניות ספורות, מה שמתאים לצינורות עבודה אינטראקטיביים בזמן אמת.

  • סצנות עם תיאורי יחסים מדויקים

    הציון הגבוה במיוחד ביחסי אובייקטים הופך אותו לפתרון מוצלח כשהפרומפט מגדיר מיקום מורכב בין פריטים.

איפה זה נופל

למרות הציונים הגבוהים, פירוק המדדים חושף נקודת חולשה ברורה. במבחן DPG-Bench בקטגוריית Global, המודל קיבל ציון של 76.44 בלבד, נפילה ניכרת לעומת Flux.1-dev שקיבל 85.80 או DALL-E 3 עם 90.97. זה אומר שהוא עלול לפספס את הקומפוזיציה הכללית או את האווירה הרחבה של הפריים. בנוסף, הוא תומך רשמית באנגלית בלבד, כך שפרומפטים בעברית ידרשו תרגום מוקדם. הרצת ההסקה תלויה גם בהורדה ברקע של Llama 3.1 8B, תלות שיכולה לתקוע את הסקריפט אם יש בעיות רשת.

שאלות
נפוצות

האם המודל מבין פרומפטים בעברית?

המודל אומן ותועד עבור השפה האנגלית בלבד. אם תזינו לו טקסט ישירות בעברית התוצאות יהיו בלתי צפויות, ולכן חובה להעביר את הפרומפט דרך שכבת תרגום לאנגלית לפני הפנייה למודל.

האם חייבים להוריד מודלים נוספים כדי שהוא יעבוד?

כן, סקריפט ההסקה מושך אוטומטית את Meta-Llama-3.1-8B-Instruct עבור קידוד הטקסט. אם השרת שלכם לא מחובר לאינטרנט בזמן הריצה, תצטרכו להוריד את הקבצים של מטא מראש ולשמור אותם בתיקיית המטמון.

מה ההבדל בין גרסת Fast לגרסאות האחרות של המודל?

גרסת Fast עברה תהליך זיכוך שמאפשר לה לייצר פלט בשניות בודדות, בניגוד לגרסת full שדורשת יותר שלבי חישוב. היא מיועדת למי שצריך תגובה מהירה בלי לספוג את זמן ההמתנה של המודל המלא.

איך מריצים

כדי להריץ אותו מקומית מורידים את הקוד מ־GitHub ומריצים סקריפט הסקה עם הדגל שמצביע על גרסת ה־fast. צריך סביבת פייתון עם ספריית diffusers והתקנה ידנית של Flash Attention, כאשר ההמלצה הרשמית היא לעבוד עם CUDA 12.4. המודל מגיע גם עם ממשק בדיקה מבוסס Gradio.

בפועל, 43.9 גיגה-בייט של משקלים יחד עם צורך בהרצת מקודדי טקסט כבדים כמו Llama 3.1 ו־T5 דורשים חומרת שרתים חזקה עם כרטיסי מסך עתירי זיכרון (VRAM). אם אין לכם גישה למעבדים גרפיים ייעודיים ברמת מרכזי נתונים, שווה לבדוק את השירות המנוהל של החברה במקום לנסות להרים את כל המערך הזה עצמאית.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("HiDream-ai/HiDream-I1-Fast")
img = pipe("a photo").images[0]

הקבצים

36 קבצים במאגר, 43.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד ומשקלי הטרנספורמר משוחררים תחת רישיון MIT, שמתיר שימוש מסחרי חופשי ושינוי קוד. עם זאת, התמונה מורכבת יותר כי המודל משלב רכיבים חיצוניים: ה־VAE נלקח מ־FLUX.1 schnell תחת Apache 2.0, ומקודדי הטקסט כוללים את T5 ואת Llama 3.1 8B הכפוף לרישיון הקהילתי של מטא. אם אתם אורזים אותו למוצר, אתם חייבים לעמוד גם בתנאי השימוש של מטא.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗