GPT
G

gemma-4-26B-A4B-it-GGUF

קוד פתוח

unslothapache-2.02026-04-01

  • gguf
  • gemma4
  • unsloth
  • gemma
  • google

גרסת MoE יעילה שמחזיקה 25.2 מיליארד פרמטרים אבל מפעילה רק 3.8 מיליארד בכל שלב. היא מספקת יכולות ראייה וטקסט במהירות ריצה של מודל קטן עם חלון הקשר עצום.

  • 262,144טוקנים בהקשר
  • 366 GBמשקל הקבצים
  • 680,580הורדות בחודש
  • 1,110לייקים

מה זה

הארכיטקטורה כאן מחלקת 25.2 מיליארד פרמטרים על פני 128 מומחים, כאשר 8 מומחים בלבד ומומחה משותף אחד פעילים בכל טוקן. בזכות המבנה הזה מקבלים מהירות חישוב שקרובה למודל של 4 מיליארד פרמטרים, אבל עם קיבולת ידע של רשת גדולה בהרבה. המודל מתמודד עם תמונות ברזולוציות משתנות, וידאו של עד דקה בחלוקה לפריימים, וטקסט בחלון של עד 256 אלף טוקנים בעזרת שילוב של שכבות קשב מקומיות וגלובליות.

במבחני ביצועים הוא עומד קרוב מאוד לגרסה המלאה של 31 מיליארד פרמטרים. במתמטיקה הוא מציג 88.3 אחוזים ב־AIME 2026 ללא כלים וציון של 1718 ב־Codeforces, מה שמציב אותו ברמה טובה לקוד ופתרון בעיות טכניות. בראייה ממוחשבת הוא רושם 82.4 אחוזים במבחן MATH-Vision, כך שהוא יודע לקרוא דיאגרמות, מסמכים וממשקי משתמש בלי לאבד פרטים קריטיים.

מתאים ל

  • ניתוח מסמכים וממשקים

    קריאת טפסים, צילומי מסך ודיאגרמות ברזולוציה גמישה בעזרת מודל ראייה של 550 מיליון פרמטרים.

  • סוכני קוד מהירים

    הרצת פעולות וקריאות לפונקציות עם 77.1 אחוזים ב־LiveCodeBench ובמהירות של 4 מיליארד פרמטרים פעילים.

  • פתרון בעיות עם חשיבה

    מצב חשיבה מובנה שמאפשר ניתוח מתמטי ולוגי צעד אחר צעד לפני הפקת התשובה הסופית למשתמש.

איפה זה נופל

למרות השם של המשפחה, בגרסה הזו אין תמיכה מובנית בקול, בניגוד לדגמי E2B ו־E4B הקטנים. בנוסף, יכולת השליפה שלו בהקשר ארוך יורדת משמעותית. במבחן MRCR של 8 מחטים לאורך 128 אלף טוקנים הוא מגיע ל־44.1 אחוזים בלבד לעומת 66.4 אחוזים בגרסת ה־31B הדחוסה. הוא גם מתקשה במשימות מורכבות במיוחד, עם 8.7 אחוזים בלבד במבחן HLE ללא כלי חיפוש חיצוניים, מה שאומר שהוא פחות מתאים לשאלות מחקר עמוקות ללא תמיכה של מנוע חיפוש.

אותה משפחה

gemma-4 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בקבצי אודיו כמו הגרסאות הקטנות?

לא. התמיכה באודיו קיימת רק בדגמי E2B ו־E4B. גרסת 26B A4B מוגבלת לטקסט, תמונות ווידאו ללא רכיב קול.

כמה זיכרון דרוש בפועל בשביל להריץ אותו מקומית?

למרות שהוא מפעיל רק 3.8 מיליארד פרמטרים בכל חישוב, כל 25.2 מיליארד הפרמטרים חייבים לשבת בזיכרון. בקוונטיזציה של 4 ביט תצטרכו סביב 16 עד 20 גיגה בייט של זיכרון פנוי רק עבור המשקלים, לא כולל שימוש בחלון הקשר גדול.

איך מפעילים את מצב החשיבה בשליחת הודעות?

מצב החשיבה מופעל על ידי הוספת הטוקן הייעודי בתחילת הודעת המערכת, או על ידי הגדרת הפרמטר המתאים בתבנית הצ'אט של הספרייה שבה אתם משתמשים.

איך מריצים

החבילה הנוכחית שוקלת 366 גיגה בייט ומחולקת ל־34 קבצים שמכילים גרסאות שונות בפורמט GGUF. למרות שהחישוב עצמו דורש כוח של 3.8 מיליארד פרמטרים בלבד, צריך מספיק זיכרון כדי לטעון את כל 25.2 מיליארד הפרמטרים של המודל למערכת. אפשר להריץ אותו דרך llama.cpp או Unsloth Studio, כאשר מומלץ להוריד רק את קובץ ה־GGUF ברמת הקוונטיזציה שמתאימה לזיכרון שלכם ולא את כל התיקייה.

מבחינת חומרה, תצטרכו כרטיס גרפי עם מספיק VRAM כדי להחזיק את המשקלים, או לשלב הרצה על גבי RAM של המעבד במחיר של ירידה בקצב היצירה. אם אין לכם תחנת עבודה ייעודית עם כרטיס מקצועי או לפחות 32 עד 64 גיגה בייט של זיכרון מהיר שפנוי לטעינת המודל והקשרו הרחב, קריאה ל־API תהיה מהירה וזולה יותר מהתעסקות מקומית.

ollama run hf.co/unsloth/gemma-4-26B-A4B-it-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הקוד והמשקלים משוחררים תחת רישיון Apache 2.0 המלא. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לאמן עליו ולשלב אותו במוצרים סגורים ללא תשלום תמלוגים, כל עוד שומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗