GPT
H

Hunyuan-A13B-Instruct

קוד פתוח

tencentother2025-06-25

  • transformers
  • safetensors
  • hunyuan_v1_moe
  • text-generation
  • conversational

מודל מומחים של טנסנט שמריץ רק 13 מיליארד פרמטרים בפועל מתוך 80 מיליארד. הוא מיועד למי שמחפש יכולות חשיבה עמוקה והפעלת כלים בלי לשלם בחומרה של מודל ענק.

  • 80Bפרמטרים
  • 32,768טוקנים בהקשר
  • 150 GBמשקל הקבצים
  • 42,481הורדות בחודש

מה זה

טנסנט בנו כאן מודל תערובת מומחים שמשלב נפח כולל גדול עם משקל חישובי נמוך בכל טוקן. ברירת המחדל שלו היא מצב חשיבה ארוך, שבו הוא מייצר שרשרת מחשבה פנימית לפני התשובה, אבל אפשר לכבות את המנגנון הזה עם דגל פשוט ולעבור למענה מהיר.

במדדים של מתמטיקה ופתרון בעיות הוא עומד קרוב מאוד למודלים כמו דיפסיק R1, עם 87.3 ב־AIME 2024 ו־94.3 ב־MATH. ההבדל הבולט מגיע דווקא בסוכנים והפעלת פונקציות, שם הוא עוקף את המתחרים במבחני BFCL ו־ComplexFuncBench, מה שהופך אותו למעניין בעיקר למי שרוצה אוטונומיה ולא רק צ'אט.

מתאים ל

  • סוכנים מבוססי כלים

    ציונים גבוהים במיוחד ב־BFCL ופרסר מובנה לכלים הופכים אותו ליעיל בהפעלת פונקציות ו־API חיצוני.

  • פתרון בעיות מתמטיות

    מצב החשיבה המובנה מספק תוצאות חזקות מאוד במבחני AIME ומתאים למערכות חישוב ולוגיקה מורכבת.

  • מענה טכני מהיר

    כיבוי מצב החשיבה מאפשר להשתמש בארכיטקטורת 13B הרזה לשליפת תשובות מהירה בלי עיכובים מיותרים.

איפה זה נופל

למרות שהארכיטקטורה תומכת ב־256 אלף טוקנים, הקובץ מוגדר מראש ל־32 אלף כדי למנוע קריסות זיכרון, והגדלה של החלון דורשת משאבים כבדים מאוד. מעבר לזה, במשימות של כתיבה חופשית, שליטה באורך טקסט והבנת שפה טבעית כללית הוא מפגר אחרי מודלים ייעודיים, כך שהוא ממש לא הבחירה הראשונה ליצירת תוכן שיווקי. בנוסף, רכיב פיענוח החשיבה ב־vLLM עדיין נמצא בפיתוח, מה שדורש בדיקה ידנית של הפלטים לפני שמחברים אותו למערכת מבצעית.

אותה משפחה

Hunyuan יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להריץ את המודל הזה על כרטיס מסך ביתי אחד?

לא בגרסה הזו. הקבצים שוקלים 150 גיגה בייט ומחייבים פיצול על פני כמה כרטיסים מקצועיים עם שפע זיכרון וידאו. לחומרה צנועה יותר עדיף לחכות או להשתמש בגרסת ה־GPTQ-Int4 ששוחררה במקביל.

איך מבטלים את זמן החשיבה הארוך שלו אם רוצים תשובה מיידית?

המודל מגיע עם מצב חשיבה פעיל כברירת מחדל. אפשר לכבות אותו על ידי העברת הדגל enable_thinking כערך שלילי בפקודת הטמפלייט, או פשוט להוסיף את המחרוזת no_think בתחילת הפרומפט.

איך מריצים

כדי להריץ אותו בפורמט המקורי צריך שרת רציני. המשקלים לבדם שוקלים 150 גיגה בייט, והדוגמאות של טנסנט דורשות חלוקה לארבעה כרטיסי מסך, אפילו כרטיסי H20 של 96 גיגה בייט אם רוצים לנצל את ההקשר המלא. מי שמחזיק תחנת עבודה יחידה יצטרך לפזול לגרסאות המכווצות ששוחררו איתו, כמו FP8 או אינט 4.

אפשר להרים אותו עם vLLM, SGLang או TensorRT דרך תמונות דוקר מוכנות. אם אין לכם קלאסטר כזה בענן, עדיף בהרבה לפנות ל־API של טנסנט במקום לשרוף כסף על שרתים ייעודיים כבדים.

from transformers import pipeline

pipe = pipeline("text-generation", model="tencent/Hunyuan-A13B-Instruct")
print(pipe("שלום"))

הקבצים

46 קבצים במאגר, 150 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other ומפנה לקובץ חיצוני במאגר הגיטהאב של טנסנט. זה אומר שלא מדובר ברישיון קוד פתוח מוכר וסטנדרטי כמו אפאצ'י או MIT, ולכן אי אפשר להניח שמותר לשלב אותו ישירות במוצר מסחרי. לפני שמטמיעים אותו, חובה לקרוא את המסמך המקורי במאגר שלהם ולוודא אילו מגבלות שימוש מסחריות חלות עליכם.

הרישיון המלא בעמוד המודל ↗