GPT
H

Hy4-preview

קוד פתוח

tencentapache-2.02026-08-27

  • transformers
  • safetensors
  • hy_v4
  • text-generation
  • hunyuan

מודל ענק בתצורת MoE עם חלון של מיליון טוקנים ורישיון חופשי. הוא מכוון לעבודה מורכבת בקוד ובמחקר, אבל דורש חומרת קצה רק כדי להיטען.

  • 780Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 1.4 TBמשקל הקבצים
  • 7,193הורדות בחודש

מה זה

מדובר במודל ענק עם 770 מיליארד פרמטרים בסך הכול, מתוכם 49 מיליארד מופעלים בכל טוקן, לצד שכבת חיזוי מובנית שמוסיפה עוד 10 מיליארד. הארכיטקטורה מחלקת 77 מתוך 78 השכבות ל־256 מומחים ועוד מומחה משותף, כך שבפועל רצים 8 מומחים בכל שלב. ההקשר העצום של מיליון טוקנים נשען על מנגנון קשב דליל בשם Gated DSA שממחזר אינדקסים בין שכבות כדי לא לחנוק את הזיכרון.

המשקולות מכוונות למשימות פיתוח תוכנה מורכבות, ניתוח מסמכים מרובים וחישובים מדעיים. במבחן פנימי עיוור של טנסנט מול מומחים על 203 משימות הנדסה, הוא ניצח בדוחק מודלים מתחרים כמו GLM 5.3 עם 46.8 אחוזי ניצחון ו־Kimi K3 עם 51.2 אחוזים. ההבדלים בציונים הממוצעים היו שברירי נקודה בלבד, כך שלא מדובר בפער תהומי על פני המתחרים הישירים שלו.

מתאים ל

  • ניתוח בסיסי קוד ענקיים

    חלון של מיליון טוקנים מאפשר להזין תיקיות פרויקט שלמות לתכנון וניפוי שגיאות רוחבי.

  • חילוץ מידע מדוחות מורכבים

    הוא מעבד ערמות של קבצים ומייצר מסמכים וטבלאות פיננסיות בדיוק גבוה.

  • מחקר מדעי ומתמטי

    מצב החשיבה המובנה מתאים במיוחד לשאלות פיזיקה וחישובים שדורשים הסקה רב שלבית.

איפה זה נופל

זהו שחרור מוקדם, והמפתחים עצמם מודים בשתי בעיות תפעוליות מעצבנות. הוא מבזבז יותר מדי זמן על שרשראות חשיבה במשימות מורכבות, ונוטה לבדוק את עצמו שוב ושוב במעגלי אימות מיותרים. בנוסף, ברירת המחדל מוגדרת למצב חשיבה עמוק שמאט משמעותית את קצב התשובה, כך שלמשימות פשוטות תצטרכו לכבות את המנגנון הזה ידנית דרך הפרמטרים. אם המוצר שלכם צריך זמני תגובה מהירים, הוא עלול לתסכל.

שאלות
נפוצות

אפשר להריץ את המודל המלא על שרת בודד עם כרטיס RTX אחד?

לא. המודל שוקל 1.4 טרה־בייט ומכיל 770 מיליארד פרמטרים. תצטרכו שרת עם מערך כרטיסים ייעודי כמו 8 מאיצי שרת כדי להפעיל אפילו את גרסת ה־FP8 המכווצת.

למה המודל עונה לאט גם על שאלות שנראות פשוטות?

הוא מוגדר מראש על מצב חשיבה עמוקה שפותח שרשרת הסקה ארוכה לפני התשובה. אם המענה הישיר מספיק לכם, אפשר להעביר בהגדרות reasoning_effort עם הערך no_think כדי לחסוך את ההמתנה.

איך מריצים

המשקל המקורי עומד על 1.4 טרה־בייט בדיוק bfloat16, מה שהופך את ההרצה העצמאית לחלום רחוק לרוב המפתחים. טנסנט ממליצה להריץ שרת באמצעות vLLM או SGLang מתוך קונטיינרים מוכנים, ובפועל ההדגמות שלהם מתבססות על גרסת FP8 ומחייבות חלוקה על פני 8 מעבדים גרפיים במקביל.

אם אין לכם אשכול שרתים ייעודי עם כרטיסי שרת חזקים ורוחב פס גבוה, הניסיון להרים אותו מקומית פשוט ייכשל מחוסר זיכרון. במצב כזה, עדיף להמתין לשירותי ענן שיציעו גישה מנוהלת דרך ממשק מבוסס OpenAI מאשר לנסות להחזיק תשתית כבדה כל כך בעצמכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="tencent/Hy4-preview")
print(pipe("שלום"))

הקבצים

170 קבצים במאגר, 1.4 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 המוכר. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לבנות מעליו מוצרים סגורים ולהפיץ אותו חופשי. התנאי היחיד הוא שמירה על הודעות זכויות היוצרים ועותק הרישיון המקורי, בלי חובת תמלוגים ובלי חשיפת הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗