GPT
H

HiDream-O1-Image-Dev

קוד פתוח

HiDream-aimit2026-05-08

  • transformers
  • safetensors
  • qwen3_vl
  • image-text-to-text
  • image-text-to-image

גרסה מזוקקת של מודל תמונה מבוסס טרנספורמר, שמייצר פיקסלים ישירות ללא מקודד טקסט נפרד או VAE. היא רצה ב־28 צעדים ומיועדת למי שרוצה ביצועים גבוהים בהזרקת טיפוגרפיה ועריכה בחבילה אחת.

  • 8.8Bפרמטרים
  • 262,144טוקנים בהקשר
  • 32.8 GBמשקל הקבצים
  • 2,640הורדות בחודש

מה זה

במקום לחבר מודל שפה נפרד, מודל דיפוזיה ורכיב VAE כדי לפענח תמונה, הארכיטקטורה הזו עובדת ישירות על פיקסלים גולמיים וטקסט באותו מרחב טוקנים. זה מודל של 8.8 מיליארד פרמטרים שמבוסס על Qwen3-VL, ותומך ביצירת תמונות מאפס, עריכה מונחית הוראות ושימור זהות של דמויות לפי מספר תמונות מקור, ברזולוציה טבעית של עד 2048 על 2048.

גרסת ה־Dev היא זיקוק של המודל המלא, שחותך את תהליך ההסקה מ־50 צעדים ל־28 צעדים בעזרת מתזמן ייעודי וללא צורך בהנחיה חופשית מסיווג. בבדיקות של דיוק טקסט והצבת אלמנטים כמו GenEval ו־DPG-Bench, המודל עוקף מודלים פתוחים כבדים בהרבה כמו FLUX.1 ו־SD3.5, במיוחד ברינדור פסקאות וטקסט ויזואלי מורכב.

מתאים ל

  • שילוב כיתובים וגרפיקה

    יצירת שלטים, פוסטרים ותמונות מוצר שמכילות טקסט מרובה אזורים באנגלית, תחום שבו המודל מציג דיוק יוצא דופן.

  • החלפת בגדים ועריכת דמויות

    יצירת תמונות ששומרות על עקביות של פנים וביגוד על בסיס כמה תמונות ייחוס והנחיות תנוחה.

  • עריכת תמונות מהירה בטקסט

    הסרה או שינוי של אלמנטים בתמונה קיימת ב־28 צעדי הסקה, כשזמן התגובה קריטי יותר מאיכות מקסימלית.

איפה זה נופל

למרות מהירות הריצה המשופרת, היוצרים מציינים במפורש שעבור משימות עריכה עדיף להשתמש במודל המלא ולא בגרסת ה־Dev. יש בעיות תאימות ידועות מול גרסאות PyTorch 2.9.x בגלל תקלות בארכיטקטורת הבסיס של Qwen3-VL, מה שמגביל את סביבת ההרצה לגרסאות ישנות יותר.

מעבר לזה, במבחני העדפת משתמשים כמו HPSv3 המודל מציג ציונים נמוכים יותר בקטגוריות מדעיות או עיצוב בהשוואה לתוצאות שלו בארכיטקטורה וחיות. המבחנים בכרטיס בודקים רק אנגלית וסינית, כך שאין שום נתונים על תמיכה בשפות אחרות או בכתיבה מימין לשמאל.

שאלות
נפוצות

מה ההבדל בין גרסת ה־Dev לגרסה המלאה של המודל?

גרסת ה־Dev מזוקקת כדי לחסוך זמן חישוב, ומסיימת הפקה ב־28 צעדים לעומת 50 במודל המלא. החיסרון הוא שבעריכת תמונה היוצרים עצמם ממליצים על המודל המלא לקבלת תוצאות טובות יותר.

האם המודל תומך בעברית?

הכרטיס מציג בדיקות עבור אנגלית וסינית בלבד, שם הוא מרנדר טקסט בהצלחה גבוהה. אין תיעוד או מבחנים ליכולת שלו לייצר אותיות עבריות בצורה נכונה.

למה צריך סוכן נפרד לפרומפטים?

הארכיטקטורה כוללת סוכן שמרחיב בקשות קצרות ומפרק אותן לפרטי קומפוזיציה ומיקומי טקסט לפני יצירת הפיקסלים. אפשר להריץ אותו דרך מודל מקומי כבד או לשלוח את הבקשה לכל שירות תואם OpenAI.

איך מריצים

המשקלים שוקלים כ־32.8 גיגה-בייט, כך שבשביל לטעון אותם צריך כרטיס מסך של 40GB ומעלה, או חלוקה על פני כמה מאיצים. הקוד נשען על ספריית transformers עם סקריפטים ייעודיים של הפרויקט, ומחייב התקנה של flash-attn. מי שלא יכול להתקין את ההרחבה הזו יצטרך לכבות אותה ידנית בקובץ הפייפליין כדי שהקוד יעלה.

ההבדל העיקרי מול הגרסה המלאה הוא זמני הריצה. גרסת ה־Dev מתוכננת ל־28 צעדים מהירים, אבל בעריכת תמונה עם מקור יחיד ברירת המחדל שלה עוברת למתזמן flow match. אם רוצים להשתמש גם בסוכן עיבוד הפרומפטים המובנה שמבוסס על Gemma-4-31B, הדרישות לחומרה מקומית מזנקות, ולכן עדיף להפנות את הסוכן לממשק API חיצוני.

from transformers import pipeline

pipe = pipeline("image-text-to-image", model="HiDream-ai/HiDream-O1-Image-Dev")
print(pipe("שלום"))

הרישיון

המודל והקוד מופצים תחת רישיון MIT. זה מאפשר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי הקוד, שילוב במוצרים סגורים והפצה מחדש, בלי תמלוגים או הגבלות שימוש מיוחדות, כל עוד משאירים את הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗