GPT
Q

Qwen3.6-35B-A3B-APEX-GGUF

קוד פתוח

mudlerapache-2.02026-04-17

  • gguf
  • quantized
  • apex
  • moe
  • mixture-of-experts

גרסת GGUF מכווצת למודל MoE עם 35 מיליארד פרמטרים שרק 3 מיליארד מהם פעילים בכל טוקן. שיטת הכיווץ שומרת על יציבות התשובות בלי לדרוש שרת מפלצתי.

  • 137 GBמשקל הקבצים
  • 386,874הורדות בחודש
  • 198לייקים

מה זה

המאגר הזה מציע קווינטיזציה מבוססת APEX למודל Qwen 3.6 35B-A3B. מדובר במבנה תערובת מומחים עם 256 מומחים מנותבים ומומחה משותף על פני 40 שכבות, כשרק 8 מומחים נדלקים בכל טוקן. הארכיטקטורה משלבת תשומת לב מלאה בכל שכבה רביעית לצד שכבות לינאריות או ממבה, וכוללת גם מודול ראייה נפרד של כג'יגה בייט בשם mmproj שמספק הבנת תמונות.

החידוש בשיטה הזו מתמקד באופן שבו דוחסים את המשקלים. במקום לחתוך את כל השכבות באותה צורה, שומרים על דיוק גבוה בחמש השכבות הראשונות והאחרונות ובמנגנוני תשומת הלב, ודוחסים חזק יותר רק את המומחים הפנימיים באמצע הרשת. המדידות מראות שגרסאות ה־imatrix חותכות את סטיית התקן המקסימלית לעומת מודל המקור ביותר מחצי בהשוואה לגרסאות ללא כיול, ובפרופיל של 24 ג'יגה בייט מתקבל פיזור חריגות נמוך אפילו מזה של קווינטיזציה סטנדרטית בשמונה ביט.

מתאים ל

  • ניתוח מסמכים ותמונות מקומי

    מודול הראייה הנפרד מאפשר לחלץ מידע מתמונות ומסמכים סרוקים בתוך תשתית פרטית לחלוטין.

  • הסקה מהירה בכרטיס בודד

    הפעלה של 3 מיליארד פרמטרים מתוך 35 מיליארד מאפשרת קצב יצירת טוקנים מהיר על חומרה של 24GB.

  • סוכן אוטומטי להרצת כלים

    כיול ה־imatrix כולל דוגמאות של קריאות לכלים וקוד, מה שמבטיח עקיבה יציבה יותר אחרי פקודות.

איפה זה נופל

בגרסאות המכווצות ביותר איכות הפלט נפגעת בצורה ברורה. גרסת I-Mini בגודל 14 ג'יגה בייט מציגה זינוק במדד הפרפלקסיטי ל־7.238 לעומת 6.722 במקור, מה שאומר יותר בלבול ואיבוד דיוק בטקסטים מורכבים. בנוסף, חובה להוריד ולהטעין את קובץ הראייה הנפרד כדי לקבל יכולת ניתוח תמונה, והמערכת דורשת גרסה עדכנית של llama.cpp כדי להתמודד עם שילוב השכבות הלינאריות.

שאלות
נפוצות

איזו גרסה כדאי להוריד מתוך הרשימה?

אם כרטיס המסך שלכם מכיל 24 ג'יגה בייט זיכרון, בחרו ב־I-Balanced כי היא מציגה את הסטייה הנמוכה ביותר ממודל הבסיס. אם אתם מוגבלים לכרטיס של 16 ג'יגה בייט, בחרו ב־I-Compact בגודל 17 ג'יגה בייט עם פריקה קלה לזיכרון המערכת.

מה צריך לעשות כדי שהמודל יבין תמונות?

צריך להוריד בנפרד את הקובץ mmproj.gguf ששוקל כג'יגה בייט אחד ולטעון אותו במקביל לקובץ השפה הראשי. בלי הקובץ הזה המודל יפעל במצב טקסט בלבד ולא יוכל לפענח קלטי מולטימדיה.

מה המשמעות של התחילית I בשמות הקבצים?

התחילית מציינת שימוש במטריצת חשיבות שנבנתה מתוך נתוני כיול מגוונים כמו קוד, שיחה והפעלת כלים. בפועל זה מקטין משמעותית טעויות קיצוניות בתשובות בלי להגדיל את נפח הקובץ.

איך מריצים

המודל רץ ישירות דרך LocalAI בפקודה בודדת, או באמצעות כלים שמבוססים על גרסת llama.cpp b8797 ומעלה. אם אתם רוצים את האיכות הטובה ביותר, גרסת I-Balanced דורשת כרטיס מסך עם 24 ג'יגה בייט של זיכרון ומספקת את התוצאות היציבות ביותר. גרסאות הקצה כמו I-Mini יורדות ל־14 ג'יגה בייט ומתאימות לכרטיסים צרכניים פשוטים יותר, אבל משלמות על זה באיכות.

אם יש לכם כרטיס מקומי עם 16 עד 24 ג'יגה בייט של זיכרון תצוגה, שווה להוריד את הקובץ המתאים ולהריץ אותו. אם אין לכם חומרה ייעודית כזו ונדרשת רק עבודה נקודתית בלי צורך בפרטיות מוחלטת על הברזל שלכם, שווה לפנות לממשק רשת חיצוני במקום לקנות חומרה כבדה.

ollama run hf.co/mudler/Qwen3.6-35B-A3B-APEX-GGUF:Qwen3.6-35B-A3B-APEX-I-Compact

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי, שינוי קוד, והפצה ללא תשלום תמלוגים. אתם יכולים לשלב אותו במוצרים פנימיים או מסחריים, כל עוד אתם שומרים על הודעת זכויות היוצרים והרישיון המקורי בקבצים שמפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗