GPT
H

Hy3

קוד פתוח

tencentapache-2.02026-07-02

  • transformers
  • safetensors
  • hy_v3
  • text-generation
  • hunyuan

מודל מומחים ענק שמשפעל 21 מיליארד פרמטרים מתוך כמעט 300 מיליארד, עם תמיכה מובנית בחשיבה עמוקה והפעלת כלים. הוא מתאים למי שצריך ביצועים של מודל ענק בלי לשלם על כל המשקלים בכל טוקן.

  • 299Bפרמטרים
  • 262,144טוקנים בהקשר
  • 557 GBמשקל הקבצים
  • 12,289הורדות בחודש

מה זה

מדובר במודל MoE עם 192 מומחים שמפעיל שמונה בכל שלב, בתוספת שכבת MTP לחיזוי מואץ של טוקנים. הוא מכיל 295 מיליארד פרמטרים בסך הכל וחלון הקשר של 256 אלף טוקנים. לפי המפתחים, הגרסה הזו נבנתה אחרי אימון המשך על נתונים ממוצרים אמיתיים, והיא מתחרה ישירות במודלים פתוחים גדולים בהרבה בתחומי פיתוח תוכנה, דאטה, וניתוח נתונים פיננסי.

בבדיקה עיוורת מול מומחים אנושיים שבדקו משימות עבודה יומיומיות, המודל עקף את GLM-5.1 עם ציון של 2.67 לעומת 2.51 מתוך 4. היתרון שלו בא לידי ביטוי בעיקר בבניית ממשקי פרונטאנד, תשתיות אחסון, ותהליכי אוטומציה של CI/CD. בנוסף, הוא כולל מנגנון שמאפשר לכבות או להפעיל חשיבה מעמיקה ישירות דרך הגדרות הבקשה.

מתאים ל

  • פיתוח פרונטאנד ו־CI/CD

    מציג יתרון מובהק בבדיקות אנושיות מול מודלים מתחרים בכתיבת קוד לממשקים ואוטומציית פיתוח.

  • סוכנים מרובי כלים

    פועל ביציבות גבוהה מול סביבות סוכנים כמו Cline וסובל מפחות מ־4 אחוזי שונות בתוצאות.

  • עיבוד מסמכים ארוכים

    תומך בחלון של 256 אלף טוקנים עם מנגנונים ייעודיים שמונעים אובדן הנחיות בטקסט ארוך.

איפה זה נופל

למרות השיפור ביציבות, במבחנים הפנימיים של המפתחים שיעור ההזיות עדיין עומד על 5.4 אחוזים, וטעויות בהיגיון בסיסי נרשמות ב־12.7 אחוז מהמקרים. בעבודה עם שיחות מרובות שלבים יש כשלים בהבנת הקשר ב־7.9 אחוז מהבדיקות. בנוסף, אין בכרטיס שום מידע על ביצועים בשפה העברית, כך שחובה לבדוק אותו מקומית לפני שמסתמכים עליו במוצר בעברית.

אותה משפחה

Hy3 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על שרת GPU בודד?

לא. המודל שוקל מעל חצי טרה-בייט בגרסת BF16, והוא דורש לפחות שמונה כרטיסי מסך מתקדמים עם זיכרון גדול כדי להיטען ולעבוד.

איך שולטים במצב החשיבה המעמיקה שלו?

שולחים בפרמטר reasoning_effort את הערך no_think לתשובות ישירות ומהירות, או high למשימות שמצריכות חישוב, קוד והסקה מורכבת.

איך מריצים

כדי להרים אותו מקומית בגרסת BF16 צריך להוריד 557 גיגה-בייט של משקלים, מה שמחייב שרת של לפחות שמונה כרטיסי מסך עתירי זיכרון כמו H20-3e. מריצים אותו דרך ספריות כמו vLLM או SGLang שנבנו מהקוד העדכני ביותר, תוך שימוש במנתחי כלים ייעודיים ובמנוע MTP כדי לקבל קצב הפקה סביר.

אם אין לכם אשכול שרתים ייעודי ותקציב חומרה כבד, עדיף להשתמש בגרסת FP8 המכווצת שפורסמה לצדו, או לפנות ל־API חיצוני. הרצה עצמאית בגודל כזה הופכת לכדאית רק כשאתם מעבדים נפחי מידע עצומים או מחויבים לשמור על המידע בתוך הרשת המקומית.

from transformers import pipeline

pipe = pipeline("text-generation", model="tencent/Hy3")
print(pipe("שלום"))

הקבצים

144 קבצים במאגר, 557 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון Apache 2.0 מלא. אתם יכולים להשתמש בו לצרכים מסחריים, לשנות את הקוד, לכוונן אותו ולהפיץ אותו כחלק ממוצר שלכם, כל עוד אתם שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗