GPT
H

Hunyuan-A13B-Instruct-GGUF

קוד פתוח

unslothother2025-07-08

  • transformers
  • gguf
  • unsloth
  • endpoints_compatible
  • imatrix

מודל מומחים של טנסנט שמריץ רק 13 מיליארד פרמטרים בפועל מתוך 80 מיליארד, ומציע ביצועים חזקים במתמטיקה וסוכנים עם תמיכה בהקשר ארוך בגרסת GGUF מכווצת.

  • 1.2 TBמשקל הקבצים
  • 1,714הורדות בחודש
  • 46לייקים

מה זה

מדובר בארכיטקטורת תערובת מומחים שבה בכל טוקן מופעלים רק 13 מיליארד פרמטרים מתוך סך כולל של 80 מיליארד. המבנה הזה נותן מהירות חישוב של מודל קטן יחסית יחד עם קיבולת ידע של מודל גדול, ותומך במעבר בין מצב חשיבה איטית ומעמיקה לבין מענה מהיר ללא שרשרת מחשבה פנימית.

במבחני ביצועים הוא עוקף את Qwen3-A22B במתמטיקה ברמת AIME 2024 עם ציון 87.3 לעומת 85.7, ורושם 78.3 במבחן הסוכנים BFCL v3 לעומת 70.8 של המתחרה. לעומת זאת, בכתיבת קוד במבחן Livecodebench הוא מגיע ל־63.9, ציון שנשאר מאחורי מודלים מובילים בתחום התכנות.

מתאים ל

  • פיתוח סוכני אוטונומיה

    התוצאה הגבוהה של 78.3 במבחן BFCL v3 הופכת אותו למתאים לקריאות פונקציות ואינטגרציות מורכבות.

  • פתרון בעיות מתמטיקה ומדע

    הוא מגיע ל־87.3 במבחן AIME 2024 ומשתמש במצב חשיבה איטית כדי לפרק שאלות חישוביות קשות.

  • ניתוח מסמכים ארוכים

    הארכיטקטורה תומכת בעד 256 אלף טוקנים לטובת סקירת טקסטים נרחבים בלי לאבד הקשר.

איפה זה נופל

במשימות של מעקב אחר הוראות מורכבות במבחן IF-Eval הוא רושם 84.7, פחות מ־OpenAI-o1 שמגיע ל־91.8, ובמבחן יצירת טקסט LengthCtrl הוא נעצר ב־55.4. כברירת מחדל אורך ההקשר בקובץ ההגדרות מוגבל ל־32 אלף טוקנים כדי למנוע קריסות זיכרון, וצריך התערבות ידנית כדי להרחיב אותו. בנוסף, מפענח החשיבה של המודל עדיין נמצא בפיתוח עבור vLLM, והפעלת כיווץ לקשב פוגעת באיכות הפלט.

שאלות
נפוצות

איך אפשר לבטל את מצב החשיבה המעמיקה כדי לקבל תשובות מהירות?

אפשר להעביר את הפרמטר enable_thinking שווה ל־False בתבנית הצ׳אט, או להוסיף את הפקודה no_think בתחילת הפרומפט. זה מדלג על שלבי הניתוח הפנימיים ומוציא ישר את הפלט הסופי.

האם המודל נפתח ישירות עם חלון של 256 אלף טוקנים?

לא. ההגדרה הראשונית מגבילה את החלון ל־32 אלף טוקנים כדי לחסוך בזיכרון ה־GPU, וצריך לעדכן ידנית את max_position_embeddings בקובץ ההגדרות או להגדיר דגל מתאים בסרבר כדי לנצל את כל האורך.

איך מריצים

בשביל להריץ אותו דרך llama.cpp צריך להשתמש בדגל jinja ולקבוע פרמטרים כמו טמפרטורה 0.7 ודגל ngl לטעינת השכבות לכרטיס המסך. למרות שגרסת המקור דורשת ארבעה כרטיסי H20 של 96 גיגה כדי לפתוח חלון מלא של 256 אלף טוקנים ב־bfloat16, גרסאות ה־GGUF כאן מאפשרות דחיסה לזיכרון נגיש יותר.

המפרט בריפו כולל עשרות קבצי קוונטיזציה במשקל מצטבר של 1.2 טרה-בייט. מי שצריך שירות ייצור כבד עם חלון מלא של מאות אלפי טוקנים וקריאות מקבילות יעדיף לגשת ל־API הרשמי של טנסנט במקום להחזיק אשכול שרתים מקומי.

ollama run hf.co/unsloth/Hunyuan-A13B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

39 קבצים במאגר, 1.2 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון בעמוד מסומן כ־other ומפנה לקובץ רישיון ייעודי במאגר של טנסנט. זה לא רישיון קוד פתוח סטנדרטי כמו MIT או אפאצ׳י, מה שמחייב קריאה מדוקדקת של תנאי השימוש המקוריים לפני שילוב שלו במוצר מסחרי.

הרישיון המלא בעמוד המודל ↗