GPT
Q

Qwen3.5-35B-A3B-APEX-GGUF

קוד פתוח

mudlerapache-2.02026-03-31

  • gguf
  • quantized
  • moe
  • apex
  • mixed-precision

גרסאות GGUF ממוטבות למודל תערובת מומחים של 35 מיליארד פרמטרים. הן מציעות דיוק גבוה ומהירות של מעל 60 טוקנים לשנייה בכרטיסי מסך ביתיים.

  • 135 GBמשקל הקבצים
  • 281,290הורדות בחודש
  • 94לייקים

מה זה

הקבצים כאן מיישמים שיטת כימות בשם APEX שפותחה עבור מודלי תערובת מומחים. הבסיס הוא מודל עם 35 מיליארד פרמטרים שמשתמש רק ב־3 מיליארד בכל טוקן, דרך 256 מומחים שונים. במקום לכווץ את כל הרשת באותה אגרסיביות, הכימות שומר על דיוק גבוה בשכבות הקצוות ובמומחה המשותף שפעיל תמיד, ומכווץ חזק יותר רק את המומחים הפנימיים שרצים לעיתים נדירות.

במבחני ביצועים, גרסת הדיוק מגיעה לתוצאת Perplexity של 6.527 בנפח של 21.3 גיגה-בייט, שזה ציון עדיף אפילו על משקל הנתונים המקורי ב־16 ביט שתופס 64.6 גיגה-בייט. גרסאות עם האות I עברו כיול על דאטה של שיחה, קוד והפעלת כלים במקום ויקיפדיה, ומציגות ציונים עדיפים במבחני הבנה וידע כמו HellaSwag שמגיע ל־83.5 אחוזים ו־ARC שמגיע ל־57.9 אחוזים.

מתאים ל

  • הפעלת עוזר מקומי בחומרה ביתית

    גרסת המיני רצה ב־74 טוקנים לשנייה על כרטיסי 16 גיגה-בייט ביתיים.

  • מענה מבוסס כלים וקוד

    גרסאות ה־I כוילו ספציפית על נתוני שיחה, תכנות והפעלת פונקציות.

  • עיבוד תמונה בקצה

    שילוב קובץ ה־mmproj בנפח 899 מגה-בייט מאפשר ניתוח תמונות ישירות בכרטיס המקומי.

איפה זה נופל

למרות השם של מודל 35 מיליארד, פועלים בפועל רק 3 מיליארד פרמטרים לטוקן, ולכן ציון ה־MMLU עומד סביב 41 אחוזים בלבד בכל הגרסאות. זהו ציון נמוך שמעיד על הבנה מוגבלת במשימות מורכבות של ידע כללי רחב. בנוסף, גרסת Mini האגרסיבית גורמת לעלייה ב־Perplexity ל־7.088, ועבור משימות של ניתוח תמונה חייבים להוריד בנפרד קובץ ששוקל 899 מגה-בייט.

שאלות
נפוצות

איזו גרסה מומלצת להתקנה כללית?

עבור כרטיס של 24 גיגה-בייט עדיף לבחור בגרסת I-Balanced או I-Quality, שמספקות איזון יציב בין מהירות לבין דיוק במבחני הבנה. עבור כרטיסי 16 גיגה-בייט, גרסת Mini היא הבחירה היחידה שנכנסת במלואה לזיכרון.

האם נדרש קוד ייעודי כדי להריץ את הכימות הזה?

לא. הקבצים נתמכים ישירות בגרסאות רגילות של llama.cpp ו־LocalAI, אך עבור תצורת Quality מומלץ להשתמש בבילד b5460 ומעלה.

איך מריצים

מריצים את הקבצים ישירות דרך llama.cpp רגיל או LocalAI, ללא צורך בהידור מותאם אישית. גרסת Mini שוקלת 12.2 גיגה-בייט ודורשת כרטיס של 16 גיגה-בייט זיכרון גרפי, כמו RTX 4060 Ti, ורצה בקצב של 74.4 טוקנים לשנייה. גרסאות Quality ו־Balanced שוקלות בין 21.3 ל־23.6 גיגה-בייט ודורשות כרטיס של 24 גיגה-בייט לפחות, למשל RTX 4090.

אם יש לכם כרטיס מסך עם 24 גיגה-בייט ואתם רוצים שרת פרטי שלא מדליף נתונים החוצה, הריצה המקומית פשוטה ומהירה מאוד. אם החומרה שלכם כוללת פחות מ־16 גיגה-בייט זיכרון גרפי, המודל ייגרר לזיכרון המערכת האיטי, ובמקרה כזה עדיף לשלם על קריאה לספק ענן מנוהל.

ollama run hf.co/mudler/Qwen3.5-35B-A3B-APEX-GGUF:Qwen3.5-35B-A3B-APEX-I-Compact

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 המלא. אפשר להשתמש בו לצרכים פנימיים, לשלב אותו במוצרים מסחריים, לשנות את הקוד ולהפיץ אותו חופשי, בתנאי ששומרים על הצהרת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗