GPT
H

HunyuanImage-3.0-Instruct

קוד פתוח

tencentother2025-09-25

  • safetensors
  • hunyuan_image_3_moe
  • image-to-image
  • custom_code

מודל אוטורגרסיבי ענק שמייצר תמונות ומבצע עריכות מורכבות על בסיס חשיבה והבנת שפה. שווה לבדוק אותו אם אתם מחפשים שילוב של מספר תמונות ושינויי עריכה חכמים בלי להסתמך על תשתית דיפוזיה רגילה.

  • 83Bפרמטרים
  • 22,800טוקנים בהקשר
  • 157 GBמשקל הקבצים
  • 19,691הורדות בחודש

מה זה

במקום מודל דיפוזיה סטנדרטי, מדובר במודל שפה ותמונה אוטורגרסיבי מאוחד שמבוסס על ארכיטקטורת תערובת מומחים. מתוך שמונים מיליארד פרמטרים בסך הכל, הוא מפעיל שלושה עשר מיליארד פרמטרים לכל טוקן דרך שישים וארבעה מומחים, מה שמאפשר לו לשמור על הבנה עמוקה בלי להקפיץ את החישוב לרמות בלתי אפשריות בכל צעד.

הוא לוקח הנחיות טקסט ותמונות קיימות, חושב עליהן בעזרת תהליך של שרשרת מחשבה, מרחיב את הפרומפט בעצמו ומייצר תוצאה שמבוססת על היגיון ויזואלי. במבחני השוואה מול בוחנים אנושיים שבדקו מעל אלף מקרים של עריכת תמונות, הדגם הזה קיבל ציונים עדיפים על פני דגמים מקבילים בעיקר בזכות ההבנה של קומפוזיציה, מיזוג של עד שלוש תמונות מקור, ושמירה על אלמנטים מרכזיים בזמן עריכה.

מתאים ל

  • עריכת תמונות מורכבת

    שינוי סגנון, הוספה ומחיקת עצמים לפי הנחיות מפורטות, כשהוא מבין את ההקשר ומחשב את השינוי לפני הייצור.

  • מיזוג מספר רפרנסים

    חיבור של עד שלוש תמונות שונות לקומפוזיציה אחת קוהרנטית תוך שמירה על מאפייני הנושאים.

  • יצירת תמונות מפרומפט דל

    הוא מנתח הוראות קצרות, מרחיב אותן פנימית עם ידע עולם ובונה תמונה מפורטת בלי צורך בהנדסת פרומפטים מורכבת.

איפה זה נופל

הדרישה לשמונה מעבדים של 80 גיגה בייט מציבה רף כניסה אכזרי, וההורדה לבדה תופסת 157 גיגה בייט של משקלים. בנוסף, כל שיטת האוטו-רגרסיה דורשת 50 צעדי דגימה כברירת מחדל בהרצה רגילה, מה שהופך את היצירה לאיטית ומסורבלת בלי אופטימיזציות מיוחדות. תהליך הרחבת ההנחיות והחשיבה האוטונומי מוסיף זמן חישוב ומקשה לעיתים לקבל שליטה מלאה ומדויקת על פיקסלים בודדים שביקשתם לא לשנות.

אותה משפחה

HunyuanImage-3.0 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב פיתוח רגיל עם כרטיס בודד?

לא. המשקלים שוקלים 157 גיגה בייט, וכרטיס המודל מגדיר דרישה מינימלית של שמונה כרטיסי מסך של 80 גיגה בייט לגרסת ההוראות הזו. לכרטיס בודד עדיף לחפש חלופות מוקטנות או שירותי ענן.

במה הדגם הזה שונה מדגם הבסיס של אותה סדרה?

דגם הבסיס מבצע רק יצירת תמונה מטקסט ודורש שלושה כרטיסי 80 גיגה בייט. גרסת ההוראות כאן כוללת תהליך חשיבה פנימי, מרחיבה פרומפטים בעצמה, תומכת בעריכה מתמונה לתמונה, אבל דורשת חומרה כפולה להרצה.

מה תפקיד מאיץ התוכנה בהתקנה?

התקנת פלאשאנפר על גבי קודה 12.8 חיונית כדי לייעל את ניתוב המומחים של המודל ומאיצה את הקצב בעד פי שלושה. הריצה הראשונה תדרוש כעשר דקות הידור, אך לאחר מכן זמני התגובה מתקצרים משמעותית.

איך מריצים

להריץ אותו מקומית דורש חומרה כבדה מאוד. לפי כרטיס המודל, גרסת ההוראות הזו דורשת שמונה כרטיסי מסך של 80 גיגה בייט כדי לרוץ, בעוד שגרסת הבסיס דורשת לפחות שלושה כרטיסים כאלה. אם החומרה הזו לא יושבת אצלכם בארון שרתים או בחשבון ענן גמיש, עדיף לפנות לגרסת הדיסטיל שממליצה על שמונה צעדי דגימה במקום חמישים, או פשוט לגשת לשרותי ענן חיצוניים.

ההרצה עצמה דורשת פייתון 3.12 וקודה 12.8, יחד עם חבילת פלאשאנפר שמקצרת את זמן ההרצה על מומחים פי שלושה. שימו לב שהרצה ראשונה לוקחת כעשר דקות רק בשביל הידור הקרנלים של המאיץ.

pip install -U huggingface_hub
hf download tencent/HunyuanImage-3.0-Instruct

הקבצים

86 קבצים במאגר, 157 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כמותאם אישית, ולא תחת רישיון קוד פתוח מוכר וסטנדרטי. המשמעות היא שאתם חייבים לבדוק לעומק את תנאי השימוש המדויקים של טנסנט לפני שאתם משלבים את המשקלים במוצר מסחרי, שכן ייתכנו הגבלות על היקף שימוש, מכירה לצד שלישי או חובות דיווח.

הרישיון המלא בעמוד המודל ↗