GPT
H

Hy3-FP8

קוד פתוח

tencentapache-2.02026-07-04

  • transformers
  • safetensors
  • hy_v3
  • text-generation
  • hunyuan

גרסת FP8 מכווצת למודל מומחים של 295 מיליארד פרמטרים, שמפעיל רק 21 מיליארד בכל טוקן. הוא נועד למי שצריך ביצועים של מודל ענק עם זמני תגובה של מודל קטן בהרבה.

  • 299Bפרמטרים
  • 262,144טוקנים בהקשר
  • 279 GBמשקל הקבצים
  • 49,433הורדות בחודש

מה זה

המודל בנוי בארכיטקטורת MoE עם 192 מומחים בסך הכול, מתוכם שמונה פעילים בכל רגע נתון. בפועל אתם מקבלים קיבולת ידע של רשת ענקית, אבל עלות החישוב בזמן ריצה מקבילה למודל בגודל 21B, מה שמאפשר להגיע למהירויות יצירה טובות יותר בהשוואה למודלים צפופים. בנוסף שולבה שכבת MTP של 3.8 מיליארד פרמטרים שנועדה לחזות כמה טוקנים קדימה ולהאיץ את ההסקה.

טנסנט כיוונו את המשקלים לשימושי פרודקשן ועבודה עם סוכנים אוטומטיים, כולל חלון הקשר של 256 אלף טוקנים. במבחנים שלהם מול 270 מומחים בתחומם, המודל השיג ציון של 2.67 מתוך 4 לעומת 2.51 של GLM-5.1, כשהפער לטובתו בלט במיוחד במשימות פיתוח פרונטאנד, אחסון ונתונים, ותהליכי אוטומציה של CI/CD. לפי הדיווח, שיעור ההזיות בבדיקות הפנימיות ירד ל־5.4 אחוזים לעומת 12.5 אחוזים בגרסה הקודמת.

מתאים ל

  • סוכני פיתוח אוטונומיים

    שומר על יציבות של ארבעה אחוזים בלבד במעבר בין סביבות עבודה שונות כמו CodeBuddy או Cline.

  • ניתוח מסמכים ארוכים

    חלון של 256 אלף טוקנים מאפשר לבלוע קובצי לוג, קוד שלם או דוחות כספיים בפעימה אחת.

  • קריאות לפונקציות וכלים

    כולל פארסר ייעודי שמתקן שגיאות ומאפשר הפעלת כלים חיצוניים באמינות גבוהה.

איפה זה נופל

למרות הירידה בהזיות, הכרטיס מודה שעדיין נרשמו 12.7 אחוזי שגיאות הנובעות מהיגיון בסיסי שגוי, ושיעור כשל של 7.9 אחוזים בשיחות מורכבות ומרובות שלבים. בנוסף, חלון הקשר של 256 אלף טוקנים על מודל בגודל כזה יזלול זיכרון מהר מאוד, מה שידרוש חומרה יקרה בהרבה מהמינימום הנדרש להרצה בסיסית. אין בכרטיס שום התייחסות לתמיכה בשפה העברית, ולכן חובה לבדוק את איכות הטקסט והתרגום לפני שמשלבים אותו במוצר שמיועד לקהל מקומי.

אותה משפחה

Hy3 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להריץ את המודל על שרת של ארבעה כרטיסי A100 או RTX 4090?

לא. משקל הקבצים עומד על 279 גיגה בייט, ובלי לפחות שמונה כרטיסים עם זיכרון גדול לא תוכלו אפילו לטעון את המודל לזיכרון, עוד לפני חישוב ה־KV Cache.

מה ההבדל בין מצבי החשיבה השונים שהמודל מציע?

הוא תומך בפרמטר reasoning_effort המאפשר לעבור בין no_think לתשובות מהירות וישירות, לבין high שמפעיל שרשרת חשיבה עמוקה לפתרון בעיות מתמטיקה ותכנות מורכבות.

איך מריצים

בשביל להריץ את המודל תצטרכו שרת עם שמונה כרטיסי מסך חזקים. היצרן ממליץ במפורש על שמונה מאיצי H20-3e או כרטיסים מקבילים בעלי נפח זיכרון גדול במיוחד, כי המשקלים המכווצים לבדם תופסים 279 גיגה בייט לפני חישוב זיכרון ההקשר לפעולה.

ההרצה המעשית מתבצעת דרך מנועי vLLM או SGLang, עם תמיכה בשכבת ה־MTP ופענוח מובנה לקריאות כלים וחשיבה. אם אין לכם גישה לשרת של שמונה כרטיסים ברמת דאטה סנטר, אל תנסו לדחוף את זה למחשב מקומי, במקרה כזה עדיף לקרוא למודל דרך ספק ענן או API חיצוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="tencent/Hy3-FP8")
print(pipe("שלום"))

הקבצים

143 קבצים במאגר, 279 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקלים שוחררו תחת רישיון Apache 2.0 המלא. אפשר להשתמש בו לצרכים מסחריים, להטמיע במוצרים סגורים, לשנות את המשקלים ולאמן אותם הלאה, בלי לשלם תמלוגים ובלי לפתוח את הקוד שלכם, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗