GPT
H

Hunyuan-7B-Instruct

קוד פתוח

tencentרישיון לא דווח2025-07-30

  • transformers
  • safetensors
  • hunyuan_v1_dense
  • text-generation
  • conversational

שילוב של חשיבה אטית מובנית עם התמקדות במשימות סוכנים ומתמטיקה. מתאים למי שרוצה חלופת קוד פתוח בינונית עם מענה מפורט בשרשרת מחשבה.

  • 7.5Bפרמטרים
  • 32,768טוקנים בהקשר
  • 14.0 GBמשקל הקבצים
  • 13,294הורדות בחודש

מה זה

מדובר במודל דחוס בגודל 7.5 מיליארד פרמטרים שפותח על ידי Tencent ומגיע ישירות עם תמיכה בשני מצבי חשיבה, אטי עם שרשרת מחשבה ומהיר בלעדיה. בניגוד לרוב המודלים בנפח הזה שדורשים פרומפט ייעודי כדי לעצור ולחשוב, כאן מנגנון הנימוק מופעל כברירת מחדל וניתן לכיבוי באמצעות פרמטר או פקודה קצרה בטקסט.

במבחני ביצועים הוא מציג ציונים גבוהים במיוחד בפתרון בעיות, כמו 81.1 ב־AIME 2024 ו־93.7 ב־MATH. התוצאות האלה מראות שהוא מכוון חזק ללוגיקה וקוד, שם הוא עוקף מודלים מקבילים בקטגוריה. עם זאת, במבחני עובדות כלליות כמו simpleQA הוא מקבל רק 5.69, מה שמעיד על פער משמעותי בין יכולת חישוב לבין ידע כללי נקי.

מתאים ל

  • פתרון חישובים ובעיות לוגיות

    מצב החשיבה המובנה משיג מעל 81 נקודות ב־AIME ומתאים למשימות שמחייבות פירוק שלבי עבודה.

  • סוכנים מבוססי קריאות לפונקציות

    הוא אומן ייעודית למשימות סוכן ורושם ציון של 70.8 במבחן BFCL v3 המיועד לבדיקת אינטראקציה עם כלים.

  • שרת מקומי דל משאבים ב־Int4

    הכיול ב־AWQ ו־GPTQ שומר כמעט לחלוטין על הדיוק במבחנים ומאפשר ריצה על כרטיס תצוגה צרכני פשוט.

איפה זה נופל

החולשה המרכזית שלו היא שליפת עובדות מדויקת. ציון של 5.69 במבחן simpleQA וציון של 38.86 בגרסה הסינית מראים שהוא נוטה להמציא פרטים כששואלים אותו שאלות ידע ישירות. בנוסף, חלון ההקשר במפרט הטכני מוגדר ל־32,768 טוקנים למרות שהתיעוד מזכיר תמיכה ארוכה יותר, ואין שום נתונים על התנהגות בעברית כך שחובה לבדוק אותו עצמאית לפני הטמעה.

אותה משפחה

Hunyuan יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית ישר מהקופסה?

הכרטיס לא מציין נתוני אימון או ציוני בדיקה בעברית, אלא מתמקד באנגלית ובסינית. הוא כנראה יידע לענות בעברית מסוימת, אבל לוגיקה מורכבת עלולה להישבר ללא בדיקה יסודית מראש.

איך מבטלים את שרשרת המחשבה כדי לקבל תשובות מהירות?

אפשר להעביר את הפרמטר enable_thinking שווה ל־False בקריאה לתבנית השיחה. דרך נוספת היא להוסיף את המחרוזת no_think בתחילת הפרומפט שאתם שולחים.

איך מריצים

המשקל בגרסת הבסיס תופס 14 גיגה בייט בפורמט bfloat16, כך שתצטרכו כרטיס מסך בודד עם לפחות 16 עד 24 גיגה זיכרון כדי לטעון אותו ולשמור מקום לטוקנים. המודל נתמך בספריות המוכרות כמו vLLM, SGLang ו־TensorRT-LLM, ויש לו גרסאות מכווצות ב־FP8 ו־Int4 שמורידות את דרישות החומרה כמעט בלי לפגוע בציוני הבנצ'מרק.

אם אין לכם כרטיס מתאים או שאתם לא רוצים לתחזק תשתית, Tencent מחזיקה ענן משלה עם API למודל. להרצה עצמית יש יתרון רק כשאתם חייבים שליטה מלאה בנתונים או כוונון עדין באמצעות LLaMA-Factory.

from transformers import pipeline

pipe = pipeline("text-generation", model="tencent/Hunyuan-7B-Instruct")
print(pipe("שלום"))

הרישיון

הרישיון לא מוגדר בקובצי המטא של הדף, למרות שבתיעוד יש הפניה לקובץ רישיון בגיטהאב. מצב שבו לא דווח רישיון רשמי במאגר אומר שאין אישור משפטי מפורש לשימוש מסחרי, ומומלץ לבדוק את הקובץ במקור לפני שמשלבים אותו במוצר.

הרישיון המלא בעמוד המודל ↗