GPT
Q

Qwen3.6-35B-A3B-APEX-MTP-GGUF

קוד פתוח

mudlerapache-2.02026-05-16

  • gguf
  • quantized
  • apex
  • apex-mtp
  • moe

גרסת GGUF שמכווצת מודל מומחים של 35 מיליארד פרמטרים וכוללת ראש חיזוי מובנה. המטרה היא להריץ הסקת מסקנות ספקולטיבית מהירה בלי להחזיק מודל טיוטה נפרד.

  • 215 GBמשקל הקבצים
  • 24,555הורדות בחודש
  • 71לייקים

מה זה

המאגר הזה מציע קווינטיזציה מסוג APEX לארכיטקטורת תערובת מומחים, שבה יש 256 מומחים מנותבים ומומחה משותף אחד, כשבכל טוקן פועלים רק שמונה מומחים. בשיטה הזו חלקי המודל הפעילים תמיד נשמרים ברמת דיוק גבוהה, והמומחים המנותבים נדחסים חזק יותר כדי לחסוך מקום בלי לרסק את הביצועים.

החידוש העיקרי כאן הוא שילוב של ראש MTP ישירות בתוך קובץ ה־GGUF. במקום להוריד מודל עזר קטן כדי לזרז את יצירת הטקסט, ראש החיזוי יושב בשכבה הארבעים ואחת ומאפשר הרצה ספקולטיבית מובנית. רוב הגרסאות שומרות את הראש הזה בדיוק של Q8_0 כדי לא לפגוע באחוזי הקבלה של הטוקנים, מה שמוסיף בערך שניים וחצי אחוז לנפח הקובץ בהשוואה לגרסאות ללא ראש חיזוי.

מתאים ל

  • שרת הסקה מקומי מהיר

    הרצה מקומית על llama.cpp תוך ניצול ראש החיזוי לקבלת תפוקת טוקנים גבוהה בלי מודל טיוטה נוסף.

  • חיסכון במשאבי שרת

    מודל מומחים שמפעיל שמונה מומחים בלבד לכל טוקן ומאפשר תגובה מהירה ביחס לגודל הפרמטרים הכולל.

  • סוצי איסוף וקוד עצמאיים

    כיול המודל נבנה על משימות ניתוח, כתיבת קוד ושימוש בכלים שמתאימים למערכות מבוססות סוכנים מקומיים.

איפה זה נופל

ראש החיזוי לא עבר כיול באמצעות מטריצת הפעלות כי הכלים הקיימים לא מפעילים אותו בזמן איסוף הנתונים, ולכן נאלצו להשאיר אותו על דיוק קבוע של Q8_0 ברוב הגרסאות או לדחוס אותו באופן סטטי בגרסת הננו. בנוסף, כדי שההאצה תעבוד בפועל חייבים גרסה חדשה מאוד של תוכנת ההרצה, אחרת ראש החיזוי סתם תופס מקום ומשקל בקובץ בלי לתת שום ערך.

שאלות
נפוצות

למה הקובץ גדול יותר מגרסת APEX רגילה?

הקובץ כולל שכבת שנאי נוספת עבור ראש החיזוי הספקולטיבי. השכבה הזו מוסיפה בערך שניים וחצי אחוז לגודל, שזה בערך גיגהבייט אחד, אבל חוסכת הורדה של מודל עזר שלם.

האם כל תוכנה שיודעת לקרוא GGUF תתמוך במודל?

הקובץ ייטען, אבל כדי להרוויח את יתרון המהירות של ראש החיזוי חייבים גרסה עדכנית של llama.cpp שתומכת בדגל הייעודי. בתוכנות ישנות הוא פשוט ירוץ כמודל רגיל עם שכבה מיותרת שתופסת זיכרון.

איך מריצים

בשביל להשתמש ביכולת החיזוי העצמי צריך גרסה עדכנית של llama.cpp שכוללת את הדגל draft-mtp. ההרצה נעשית ישירות דרך שרת ה־llama על קובץ בודד, למשל גרסת I-Balanced, בלי צורך לנהל מודל נוסף בזיכרון.

מבחינת חומרה, סך כל הקבצים מגיע למאות גיגהבייטים אבל מורידים רק קובץ בודד בהתאם לזיכרון הפנוי. מודל מומחים בסדר גודל כזה דורש כרטיס גרפי חזק או זיכרון אחוד בנפח של עשרות גיגהבייטים כדי לקבל מהירות סבירה. אם אין לכם חומרה ייעודית מקומית, עדיף להשתמש בשירות ענן מנוהל.

ollama run hf.co/mudler/Qwen3.6-35B-A3B-APEX-MTP-GGUF:Qwen3.6-35B-A3B-APEX-MTP-Quality

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים ולהפיץ אותם בתוך מוצרים, כל עוד משאירים את הצהרת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗