GPT
Q

Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-Distilled-APEX-GGUF

קוד פתוח

mudlerapache-2.02026-04-25

  • gguf
  • quantized
  • apex
  • moe
  • mixture-of-experts

גרסת קוונטיזציה מיוחדת למודל MoE עם זיקוק יכולות הסקת מסקנות מקלוד. המטרה היא לקבל התנהגות של מודל ענק במבנה שמפעיל רק 3 מיליארד פרמטרים בפועל בכל טוקן.

  • 212 GBמשקל הקבצים
  • 22,243הורדות בחודש
  • 86לייקים

מה זה

מדובר בהמרה לפורמט GGUF של מודל שעבר זיקוק הסקת מסקנות על בסיס Claude 4.7 Opus. המודל בנוי כארכיטקטורת תערובת מומחים עם 35 מיליארד פרמטרים בסך הכל, אך בזמן ריצה מופעלים כשלושה מיליארד פרמטרים בלבד מתוך 256 מומחים מנותבים, יחד עם מומחים משותפים. בנוסף, הארכיטקטורה משלבת מנגנון קשב היברידי שבו שכבות קשב מלא רצות רק בכל שכבה רביעית, והשאר מבוססות שכבות ליניאריות או ממבה.

הייחוד כאן הוא שיטת הדחיסה APEX שמיועדת למודלי תערובת מומחים. השיטה מזהה אילו משקולות שייכות לשכבות המומחים ודוחסת אותן חזק יותר בשכבות האמצעיות, תוך שמירה על דיוק גבוה יותר בשכבות הקצה, במנגנוני הקשב ובמומחים המשותפים. גרסאות ה־I עברו כיול מול מגוון רחב של תרחישים שכוללים שיחה, קוד, הפעלת כלים וניתוח טקסט.

מתאים ל

  • שרת הסקת מסקנות מקומי

    מערך MoE עם כ־3 מיליארד פרמטרים פעילים מאפשר מענה מהיר בניתוח בעיות בלי להחזיק חומרה ארגונית כבדה.

  • עיבוד משולב טקסט ותמונה

    קובץ ה־mmproj מאפשר להריץ משימות ראייה והבנת תמונות על גבי חומרת קצה פרטית.

  • הרצה על כרטיסי מסך ביתיים

    גרסאות ה־Compact בגודל 16 גיגה בייט נכנסות בכרטיסים נפוצים בלי לחרוג מהזיכרון הגרפי.

איפה זה נופל

יוצר המודל מציין במפורש שמבחני ביצועים כמותיים עדיין ממתינים ולא פורסמו עבור הגרסאות האלה. גרסת ה־I-Nano מוגדרת כניסיונית ודוחסת מומחים בשכבות האמצע לרמת IQ2_XXS של 2.06 ביט לפרמטר, מה שעלול לפגוע ביציבות ההיגיון במשימות מורכבות. חיסרון נוסף שחייבים לקחת בחשבון הוא התלות בקובץ הנפרד mmproj עבור יכולות ראייה, בלי הטעינה שלו עיבוד התמונה פשוט לא יעבוד.

שאלות
נפוצות

מה ההבדל בין קובץ רגיל לקובץ עם האות I בשם?

הקבצים שמכילים את האות I עברו כיול עם מטריצת חשיבות imatrix על גבי נתוני שיחה, קוד והפעלת כלים. הדחיסה שלהם מדויקת יותר לאזורים קריטיים במודל, ולכן מומלץ לבחור בהם על פני הגרסה המקבילה הרגילה.

האם המודל יפעל כמפענח תמונות מיד לאחר ההורדה של קובץ המשקולות הראשי?

לא. כדי להפעיל את יכולות הראייה הממוחשבת חובה להוריד גם את הקובץ mmproj.gguf ששוקל כגיגה בייט אחד, ולהגדיר אותו כפרויקטור ראייה במנוע ההרצה.

האם כדאי לבחור בגרסת ה־Nano בגלל הנפח הקטן?

הגרסה הזו מוגדרת ניסיונית ודוחסת מומחים לרמה של כשני ביט בלבד. אלא אם כן המגבלה בזיכרון קריטית לחלוטין, מומלץ להתחיל מגרסת ה־Mini או ה־Compact כדי לא לסבול משיבושים בתשובות.

איך מריצים

ההרצה המקומית מתבצעת דרך סביבות תואמות llama.cpp כמו LocalAI, כשהפקודה דורשת פשוט להפנות ישירות לקובץ הרצוי. קבצי הקוונטיזציה נעים מנפח של 11 גיגה בייט בגרסת ה־I-Nano הניסיונית, דרך 16 גיגה בייט לגרסאות ה־Compact שמתאימות לכרטיסי מסך ביתיים פופולריים, ועד 24 גיגה בייט לגרסאות ה־Balanced. קובץ ה־F16 המלא שוקל 65 גיגה בייט, ואם צריך עיבוד תמונה חובה להוריד גם את קובץ mmproj ששוקל כגיגה בייט אחד.

מי שאין לו כרטיס מסך עם לפחות 16 עד 24 גיגה זיכרון פנימי יתקשה לקבל מהירות סבירה על הגרסאות המאוזנות. במצב כזה, או כשצריך אמינות גבוהה בלי בדיקות מקדימות על איכות הדחיסה, עדיף להשתמש ב־API מרוחק של מודל המקור.

ollama run hf.co/mudler/Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-Distilled-APEX-GGUF:Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-Distilled-APEX-I-Compact

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו בתוך תוכנה סגורה, בתנאי שמצרפים את הצהרת הרישיון והזכויות המקורית ומציינים את השינויים שבוצעו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗