GPT
Q

Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-Distilled-APEX-MTP-GGUF

קוד פתוח

mudlerapache-2.02026-05-17

  • gguf
  • quantized
  • apex
  • apex-mtp
  • moe

גרסת קוונטיזציה של מודל מומחים שעבר זיקוק לחשיבה, עם ראש חיזוי מובנה שמאיץ את ההסקה בלי צורך במודל טיוטה חיצוני. הוא פונה למי שמחפש ריצה מקומית מהירה וזולה יחסית.

  • 215 GBמשקל הקבצים
  • 16,334הורדות בחודש
  • 71לייקים

מה זה

מדובר במודל MoE עם 40 שכבות שלד ועוד שכבת חיזוי מובנית, שמבוסס על ארכיטקטורת Qwen עם 256 מומחים מנותבים ועוד מומחה אחד משותף, כאשר שמונה מומחים פעילים בכל טוקן. המודל הבסיסי עבר זיקוק של יכולות חשיבה מתוך מודל חיצוני, והגרסה הנוכחית נבנתה בשיטת APEX, שדוחסת חזק את המומחים המנותבים ושומרת על דיוק גבוה במומחה המשותף ובשכבות הקצה.

החידוש העיקרי בחבילה הזו הוא שילוב ראש ה־MTP בתוך אותו קובץ GGUF. במקום להחזיק מודל נוסף בזיכרון כדי לבצע פענוח ספקולטיבי, הקובץ הבודד מאפשר ל־llama.cpp לחזות כמה טוקנים במקביל בעזרת הדגל המתאים, בתוספת נפח של כ־2.5% בלבד לעומת קובץ ללא הראש הזה.

מתאים ל

  • שרת הסקה מקומי מהיר

    ראש ה־MTP המובנה מאפשר לבצע פענוח ספקולטיבי מקומי מקובץ יחיד, בלי לתחזק מודל טיוטה נפרד.

  • משימות חשיבה מורכבות

    הוא נבנה על מודל שעבר זיקוק לחשיבה ומשתמש בניתוב מומחים, מה שמתאים לניתוח בעיות לוגיות.

  • הרצה מקומית עם LocalAI

    הקבצים נבנו והותאמו לעבודה ישירה מול llama.cpp וסביבות פיתוח מקומיות מבוססות GGUF.

איפה זה נופל

ראש ה־MTP לא עבר כיול באמצעות imatrix, מכיוון שהרצת הכיול הרגילה לא מפעילה את הראש הזה אלא רק את שלד המודל. היוצר נאלץ להשתמש בקוונטיזציה סטטית, מה שמוסיף כגיגה־בייט לכל קובץ. מעבר לכך, אין בכרטיס המודל מדדי ביצועים רשמיים שמוכיחים מה אחוז הקבלה של הטוקנים בפועל או עד כמה הזיקוק שימר את איכות החשיבה המקורית.

שאלות
נפוצות

האם חייבים להוריד את כל 215 הגיגה־בייט מהמאגר?

לא. המאגר מכיל גרסאות קוונטיזציה שונות באותה ספריה, וצריך להוריד רק את קובץ ה־GGUF הספציפי שמתאים לרמת הדיוק ולמגבלות הזיכרון שלכם.

מה נותן ראש ה־MTP לעומת גרסת ה־APEX הרגילה?

הוא מאפשר לבצע פענוח ספקולטיבי ישירות מתוך המודל בלי להוריד מודל טיוטה קטן נפרד. התוספת למשקל הקובץ היא בסך הכול כ־2.5%, ובתמורה מקבלים פוטנציאל למהירות הפקה גבוהה יותר בכל ריצה.

האם הכיול של המודל מכסה את כל החלקים שלו?

לא לגמרי. בעוד ששלד המודל כויל עם מערך נתונים מגוון, ראש ה־MTP קוונטז באופן סטטי ללא כיול imatrix, כי כלי הכיול הרגיל לא תומך בהפעלת שכבת החיזוי הזו.

איך מריצים

בשביל להריץ את המודל צריך גרסה עדכנית של llama.cpp שתומכת בפיצ'ר, ולהפעיל את השרת עם הדגל draft-mtp. הראש המובנה מקוונטז ברמת Q8_0 ברוב הגרסאות כדי לא לפגוע באחוזי הקבלה של הטוקנים, מלבד גרסת I-Nano שבה הדיוק נמוך יותר כדי לחסוך מקום.

המשקל הכולל של הקבצים במאגר מגיע ל־215 גיגה־בייט, אבל מורידים רק את הקובץ המתאים לרמת הדחיסה הרצויה. מודל בסדר גודל כזה של מומחים דורש חומרה מקומית חזקה עם זיכרון וידאו מספק כדי להחזיק את השכבות הפעילות, כך שאם אין לכם כרטיס מתאים עם עשרות גיגה־בייט פנויים, שימוש בשרת ייעודי בענן יהיה פשוט יותר.

ollama run hf.co/mudler/Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-Distilled-APEX-MTP-GGUF:Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-Distilled-APEX-MTP-Quality

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה מחדש. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי חובה לפתוח את הקוד של המוצר שבו תשלבו אותו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗