GPT
H

HunyuanImage-3.0

קוד פתוח

tencentother2025-09-25

  • transformers
  • safetensors
  • hunyuan_image_3_moe
  • text-generation
  • text-to-image

מודל תמונה אוטורגרסיבי ענק מבית טנסנט שמבוסס על תערובת מומחים. הוא פונה למי שרוצה להריץ עצמאית מודל ברמת ביצועים של כלים מסחריים סגורים.

  • 83Bפרמטרים
  • 22,800טוקנים בהקשר
  • 157 GBמשקל הקבצים
  • 8,021הורדות בחודש

מה זה

במקום ללכת בדרך של ארכיטקטורות הדיפוזיה הרגילות כמו DiT, טנסנט בנו מודל אוטורגרסיבי שמשלב הבנה ויצירה תחת אותה קורת גג. יש לו 80 מיליארד פרמטרים בחלוקה ל־64 מומחים, כאשר בכל טוקן מופעלים בפועל רק 13 מיליארד פרמטרים. המבנה הזה נותן לו תפיסת עולם רחבה יותר, הבנה מעמיקה של תיאורי סצנות מורכבים והיצמדות גבוהה להנחיות טקסט.

במבחני הערכה אנושיים של Good/Same/Bad שנערכו מול יותר ממאה בוחנים, כמו גם במדדי SSAE שבודקים אלפי נקודות התאמה סמנטית מול מודלי שפה רב־מודאליים, הוא מציג חדות אסתטית והבנת פרומפטים שמגיעה לביצועים של מוצרים מובילים בקוד סגור. עם זאת, הדגם הבסיסי הזה דורש שרשרת הרחבת פרומפטים חיצונית כדי להפיק ממנו את המקסימום הוויזואלי.

מתאים ל

  • יצירת תמונות מורכבות

    יצירת הדמיות ריאליסטיות עמוסות פרטים לפי תיאורים טקסטואליים ארוכים ומדויקים.

  • תשתית יצירה עצמאית

    הקמת שירות תמונות מקומי בארגונים שלא רוצים להוציא דאטה למודלים סגורים.

  • מחקר ארכיטקטורות MoE

    בחינת תהליכי יצירת תמונה באמצעות מודלי תערובת מומחים אוטורגרסיביים בקנה מידה עצום.

איפה זה נופל

הגרסה הבסיסית הזו אינה יודעת לעבות או לנסח מחדש פרומפטים קצרים בעצמה. כדי לקבל תוצאות איכותיות, הכרטיס מציין במפורש צורך במודל חיצוני כמו דיפסיק דרך טנסנט קלאוד שישכתב את ההוראות שלכם. בנוסף, יש פה באג מעצבן שטנסנט מציינים במפורש: אי אפשר לטעון את המשקולות ישירות מתוך Hugging Face עם המזהה הרשמי בגלל הנקודה בשם, וחובה להוריד את הקבצים ידנית ולשנות את שם התיקייה במחשב המקומי.

אותה משפחה

HunyuanImage-3.0 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס RTX בודד?

לא. משקל המודל לבדו מגיע ל־157 גיגה-בייט ודורש תמיכה ב־CUDA 12.8. תצטרכו שרת עם מספר כרטיסים מקצועיים וזיכרון וידאו משמעותי כדי לטעון אותו בכלל.

למה התמונות מפרומפט קצר יוצאות פחות טובות?

הגרסה הזו נשענת על שכתוב פרומפטים חיצוני כדי להוסיף עושר ויזואלי. טנסנט ממליצים לחבר מודל טקסט כמו דיפסיק בתחילת הצינור, או לעבור ישירות לגרסת ה־Instruct שמכילה מנגנון הסקת מסקנות מובנה.

איך מריצים

להריץ 157 גיגה-בייט של משקולות בפורמט bfloat16 זה לא עניין למחשב ביתי. סקריפט הדמו של Gradio מוגדר כברירת מחדל לארבעה מאיצים גרפיים, ותצטרכו חומרת שרתים עם זיכרון וידאו נרחב כדי להחזיק את המודל בזיכרון, לצד סביבת פייתון 3.12 ו־CUDA 12.8.

המפתחים ממליצים להשתמש בקרנלים של FlashInfer כדי להאיץ את חישובי ה־MoE, מה שגוזר הידור ראשוני שלוקח כעשר דקות. אם אין לכם קלאסטר זמין, שווה לבדוק את גרסת ה־Instruct או המהדורה המזוקקת שדורשת רק שמונה שלבי דגימה, או פשוט לצרוך שירותי ענן שחוסכים את תחזוקת הברזלים.

from transformers import pipeline

pipe = pipeline("text-to-image", model="tencent/HunyuanImage-3.0")
print(pipe("שלום"))

הקבצים

84 קבצים במאגר, 157 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other ולא מצורף פירוט תנאים מלא בכרטיס המודל. המשמעות היא שאין היתר שימוש מסחרי מובטח מראש, ולפני שמכניסים את המשקולות למוצר חי או למערך שרתים מסחרי, חובה לעבור על תנאי הקובץ במאגר כדי לוודא שאין הגבלות שימוש של טנסנט.

הרישיון המלא בעמוד המודל ↗