GPT
G

gemma-4-26B-A4B-it-APEX-GGUF

קוד פתוח

mudlergemma2026-04-02

  • gguf
  • quantized
  • apex
  • moe
  • mixture-of-experts

גרסת קוונטיזציה של מודל מומחים מבית גוגל שדורשת זיכרון של 4 מיליארד פרמטרים פעילים בלבד. הפתרון מיועד למי שמחפש יכולות ראייה וטקסט מקומיות בלי להחזיק שרת יקר.

  • 123 GBמשקל הקבצים
  • 405,087הורדות בחודש
  • 82לייקים

מה זה

מדובר במודל MoE עם 26 מיליארד פרמטרים בסך הכול, אבל בפועל רק 4 מיליארד מתוכם רצים בכל טוקן דרך שמונה מומחים פעילים מתוך 128. השיטה שבה כיווצו אותו מחלקת את הדיוק לפי שכבות, כך ששכבות הקצה מקבלות דיוק גבוה והשכבות האמצעיות נדחסות חזק יותר כדי לחסוך מקום.

גרסאות ה־I עברו כיול עם נתונים מגוונים שכוללים שיחה, קוד, חשיבה, קריאות לכלים ועקבות סוכנים. המודל כולל גם רכיב ראייה נפרד בגודל 1.2 גיגה בייט לפענוח תמונות. נתוני ביצועים מדויקים עדיין חסרים בעמוד, כי הכותב ביצע המרה מחדש בעקבות תיקונים במפענח הטוקנים של llama.cpp.

מתאים ל

  • עיבוד מקומי של תמונות ומסמכים

    מודל הראייה המובנה של 1.2 גיגה בייט מאפשר לקרוא ולנתח קבצים ויזואליים בלי להוציא מידע מחוץ לרשת המקומית.

  • הפעלת סוכנים וקריאות לכלים

    הכיול בגרסאות ה־I כולל נתוני שימוש בכלים ועקבות סוכנים, מה שמסייע לו לפעול לפי פורמט מובנה.

  • הרצה מקומית על חומרת צרכנים

    הפרופילים הקומפקטיים שוקלים 13 עד 15 גיגה בייט ומאפשרים עבודה מלאה על גבי כרטיס מסך בודד של 16 גיגה בייט.

איפה זה נופל

בכרטיס המודל אין עדיין תוצאות בדיקה או ציוני ביצועים רשמיים, מה שאומר שצריך לבדוק לבד את איכות הפלט בכל משימה. הקוונטיזציה נשענת על גרסה ספציפית ומעלה של llama.cpp בגלל באגים בטוקנייזר ובמנגנון הריסון של המודל המקורי, כך שתוכנות ישנות יותר פשוט ישברו את הטקסט או ייצרו פלטים שגויים לחלוטין.

שאלות
נפוצות

האם חייבים להוריד את כל הקבצים שבעמוד?

לא. משקל כל הקבצים יחד מגיע ל־123 גיגה בייט, אבל אתם צריכים לבחור רק קובץ GGUF אחד שמתאים לזיכרון שלכם. אם אתם מתכננים לנתח תמונות, תצטרכו להוריד בנוסף רק את קובץ ה־mmproj.

איזו גרסה מומלצת למי שרוצה את האיזון הטוב ביותר?

קובץ ה־I-Balanced בגודל 19 גיגה בייט מיועד לתת את יחס האיכות והגודל הטוב ביותר. אם המקום בכרטיס המסך לוחץ, גרסת ה־I-Compact שוקלת 15 גיגה בייט ומתאימה למעבדים גרפיים ביתיים נפוצים.

איך מריצים

בשביל להריץ אותו לא חייבים חומרה ארגונית כבדה. הקובץ הקטן ביותר דורש 13 גיגה בייט בלבד, מה שמאפשר לו להיכנס לכרטיסי מסך ביתיים עם 16 גיגה בייט זיכרון, בעוד גרסאות האיכות המלאות שוקלות 20 גיגה בייט. אם רוצים להשתמש ביכולות עיבוד התמונה, חובה לטעון לצדו את קובץ ה־mmproj שמוסיף עוד 1.2 גיגה בייט.

אם אין לכם כרטיס מסך מתאים עם לפחות 16 גיגה בייט זיכרון ייעודי, עדיף לפנות ל־API חיצוני של גוגל במקום לנסות להריץ מקומית על המעבד הראשי.

ollama run hf.co/mudler/gemma-4-26B-A4B-it-APEX-GGUF:gemma-4-26B-A4B-APEX-I-Compact

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא רישיון gemma של גוגל. מותר להשתמש בו לפיתוח ולצרכים מסחריים, אבל השימוש כפוף לתנאי השימוש והמגבלות המשפטיות של תוכנית גמה, כולל איסור על שימושים מזיקים מסוימים. מי שרוצה להטמיע אותו במוצר חייב לוודא עמידה בהסכם השימוש הרשמי של גוגל.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗