GPT
H

HiDream-ai/HiDream-O1-Image

קוד פתוח

HiDream-aimit2026-05-08

  • transformers
  • safetensors
  • qwen3_vl
  • image-text-to-text
  • image-text-to-image

מודל תמונה מאוחד של 8.8 מיליארד פרמטרים שעובד ישירות על פיקסלים בלי צורך במקודד טקסט נפרד או ב־VAE, ומפיק פלט חד ברזולוציה של 2048 על 2048.

  • 8.8Bפרמטרים
  • 262,144טוקנים בהקשר
  • 32.8 GBמשקל הקבצים
  • 9,828הורדות בחודש

מה זה

הארכיטקטורה מבוססת על טרנספורמר ברמת הפיקסל שמכניס טקסט, פיקסלים גולמיים ותנאי עריכה לאותו מרחב טוקנים בדיוק. הוא לא צריך לחבר מודל שפה חיצוני לרשת דיפוזיה, אלא מטפל לבד ביצירת תמונות מטקסט, עריכה לפי הוראות ושמירה על עקביות של דמות לפי כמה תמונות מקור.

בבנצ'מרקים המפורסמים במבחני המיקום והרכבת האובייקטים של GenEval הוא עומד על ציון כללי של 0.90, ועוקף מודלים פתוחים כבדים בהרבה כמו פלוקס. ברינדור טקסט ארוך באנגלית ובסינית הוא חוצה את 0.97, מה שאומר שהוא באמת מצייר מילים מדויקות ולא רק מורח אותיות חסרות פשר בתוך התמונה.

המפרסמים צירפו אליו גם סוכן פרומפטים שמפרק הוראות מורכבות לפני הרינדור, ומשתמש במודל שפה מקומי כמו ג'מה או בחיבור API חיצוני כדי לתכנן את הקומפוזיציה והמיקומים.

מתאים ל

  • רינדור שלטים וטקסט בתמונה

    ציונים גבוהים בבנצ'מרק הטקסט מבטיחים כיתובים קריאים ומדויקים בפוסטרים וגרפיקה.

  • שמירה על עקביות של דמויות

    קבלת עד עשר תמונות מקור מאפשרת להלביש את אותה הדמות בסצנות חדשות לגמרי.

  • עריכת תמונות מונחית הוראות

    שינוי או הסרת אובייקטים מתמונה בודדת לפי פקודת טקסט ישירה, בלי צורך במסיכות.

איפה זה נופל

ההתקנה לא חלקה. יש באג ידוע שפוסל שימוש בגרסאות פאיטורץ' 2.9, ואם אי אפשר להתקין אצלכם פלאש אטנשן, הריצה תיכשל אלא אם תיכנסו ידנית לקובץ הפייפליין ותשנו משתנה בוליאני בקוד. בנוסף, לעריכת תמונה צריך להישאר עם מודל ה־full הכבד או לשנות ידנית סקדולר בגרסת ה־dev, אחרת התוצאות מאבדות דיוק.

שאלות
נפוצות

אפשר להריץ את המודל על מחשב ביתי עם כרטיס מסך רגיל?

לא ממש. קובצי המשקלים לבדם שוקלים קרוב ל־33 ג'יגה בייט, וההסקה ברזולוציה מקורית של 2048 דורשת משאבי זיכרון וידאו גבוהים בהרבה ממה שיש בכרטיס גיימינג סטנדרטי של 16 או 24 ג'יגה בייט.

האם חייבים להריץ את סוכן הפרומפטים המצורף?

לא, הוא אופציונלי לחלוטין. אפשר לשלוח הנחיות טקסט ישירות לסקריפט ההסקה, אם כי לפי תיעוד המודל, הסוכן עוזר לבנות קומפוזיציות מורכבות יותר לפני הרינדור.

מה ההבדל בין גרסת הבסיס לגרסת ה־Dev?

גרסת ה־Dev עברה זיקוק ומייצרת תמונה ב־28 צעדים במקום 50, מה שמזרז את העבודה, אבל המפתחים ממליצים להישאר עם הגרסה המלאה למשימות עריכה עדינות.

איך מריצים

המשקלים תופסים 32.8 ג'יגה בייט על הדיסק, כך שכדי לטעון אותם ולהריץ הסקה של רזולוציית 2048 על 2048 תצטרכו כרטיס מסך עם זיכרון וידאו רציני של 48 ג'יגה בייט לפחות, או שרת ייעודי בענן. גרסת הבסיס דורשת 50 צעדי הסקה, בזמן שגרסת ה־Dev המזוקקת מסתפקת ב־28 צעדים ומקצרת את זמן הריצה כמעט בחצי.

אם אתם רוצים להריץ גם את סוכן הפרומפטים המקומי שמבוסס על ג'מה 31B, כבר תצטרכו עוד כרטיס מסך שלם רק בשבילו. במקרה כזה עדיף לחבר את הסוכן ל־API חיצוני תואם אופן איי איי ולחסוך את כאב הראש התשתיתי.

from transformers import pipeline

pipe = pipeline("image-text-to-image", model="HiDream-ai/HiDream-O1-Image")
print(pipe("שלום"))

הרישיון

המודל והקוד שוחררו תחת רישיון MIT מלא. אתם רשאים להריץ אותו, לשנות אותו, לשלב אותו במוצרים מסחריים ולמכור שירותים שמבוססים עליו, בלי לשלם תמלוגים ובלי חובת פתיחת קוד, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗