GPT
G

gemma-4-26B-A4B-it-qat-GGUF

קוד פתוח

unslothapache-2.02026-06-05

  • transformers
  • gguf
  • gemma4
  • image-text-to-text
  • unsloth

גרסת מומחים שמחזיקה 25.2 מיליארד פרמטרים אבל מפעילה רק 3.8 מיליארד בכל טוקן. אתם מקבלים שילוב של מהירות הרצה נמוכה עם חשיבה של מודל כבד ועיבוד תמונות מובנה.

  • 262,144טוקנים בהקשר
  • 20.1 GBמשקל הקבצים
  • 698,757הורדות בחודש
  • 410לייקים

מה זה

גוגל ודיפמיינד בנו פה ארכיטקטורת תערובת מומחים עם 128 מומחים סך הכל, שמתוכם רק 8 פועלים במקביל יחד עם מומחה משותף אחד. המשמעות פשוטה: המודל תופס זיכרון של כלי בינוני פלוס, אבל מבחינת כוח חישוב ומהירות יציאה של טוקנים הוא רץ כמו מודל של 4 מיליארד פרמטרים. הגרסה הזו של אנפלאות' מגיעה אחרי אימון מותאם לכימות, מה ששומר על רמת ביצועים קרובה מאוד למקור בחצי דיוק תוך חיתוך צריכת המשאבים.

המודל מיועד לעבודה על טקסט ותמונות ביחד, עם יכולת להבין דיאגרמות, מסמכים וממשקי משתמש. במבחני חשיבה וקוד הוא מציג מספרים מרשימים, כמו 88.3% ב־AIME 2026 וציון של 77.1% ב־LiveCodeBench. זה אומר שבמשימות אלגוריתמיות ופתרון בעיות מורכבות הוא עומד כמעט בשורה אחת עם דגם ה־31B המלא, אבל בלי שתשלמו על זה בזמן תגובה זוחל.

מתאים ל

  • ניתוח מסמכים וגרפים

    מפעיל מעבד תמונה ייעודי של 550 מיליון פרמטרים לחילוץ מידע מדוחות וצילומי מסך במהירות גבוהה.

  • סוכני קוד אוטונומיים

    תומך בקריאות לפונקציות ובמצב חשיבה מובנה שמאפשר לו לתכנן כמה צעדים קדימה לפני כתיבת קוד.

  • שרת מקומי מהיר

    מייצר טוקנים בקצב של מודל 4B הודות לארכיטקטורת המומחים, וחוסך עלויות שרת בעומסים גבוהים.

איפה זה נופל

בניגוד לדגמים הקטנים יותר בסדרה כמו 12B או E4B, הדגם הזה לא כולל מודל שמע בכלל. אם אתם בונים מערכת קולית או צריכים תמלול, הוא לא יקבל את הקבצים. נקודה בעייתית נוספת היא ירידה דרסטית בחיפוש בתוך הקשר ארוך: במבחן המחט בערימת שחת הוא השיג רק 44.1%, חלש משמעותית מגרסת ה־31B הדחוסה שעומדת על 66.4%.

בנוסף, הכרטיס מראה צניחה ל־8.7% בלבד במבחן HLE בלי כלי עזר חיצוניים, כך שחייבים לחבר לו יכולות חיפוש או ריצת קוד אם רוצים תוצאות סבירות. שימו לב גם להתנהגות התבנית: בשיחות מרובות תורות חובה לנקות את בלוק החשיבה מההיסטוריה לפני התור הבא, אחרת המודל מייצר בלבול פנימי ואיכות התשובות נפגעת.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב נייד רגיל?

לא. קובץ ה־GGUF שוקל 20.1GB ודורש לפחות 24GB זיכרון וידאו פנוי כדי לתפקד בקצב סביר. מחשב נייד בלי מאיץ גרפי ייעודי חזק יזחל או יתרסק מחוסר זיכרון.

איך מפעילים את מצב החשיבה בשאילתות?

הפעלת החשיבה נעשית על ידי הוספת הטוקן הייעודי בתחילת הוראת המערכת. המודל יפלוט את תהליך ההסקה בתוך תגיות ייעודיות לפני שיחזיר את התשובה הסופית.

האם המודל מקבל קבצי קול ישירות?

לא, בדגם ה־26B הסירו את תמיכת השמע שנמצאת בדגמים הקטנים יותר בסדרה. הוא מקבל קלט של טקסט ותמונות בלבד.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־20.1 גיגה בייט, כך שתצטרכו כרטיס מסך עם לפחות 24GB זיכרון כמו RTX 3090 או RTX 4090 כדי להעלות את כולו, במיוחד אם תרצו לנצל את חלון ההקשר המלא שמגיע עד 256 אלף טוקנים. אנפלאות' צירפו לקובץ הראשי מודל טיוטה קטן לחיזוי מרובה טוקנים, וגרסאות עדכניות של llama-server יודעות לזהות אותו אוטומטית כדי להאיץ את הפליטה.

אם יש לכם כרטיס חלש יותר עם 12GB או 16GB, חבל על המאמץ. פריקה חלקית של מודל מומחים לזיכרון המערכת ולמעבד תחנוק את קצב הריצה לרמה בלתי שמישה. בתרחיש כזה, או במקרים שבהם אתם מריצים שאילתות בודדות פעם בכמה שעות, עדיף בהרבה לקרוא ל־API מסחרי במקום לשרוף שעות על קינפוגים.

ollama run hf.co/unsloth/gemma-4-26B-A4B-it-qat-GGUF:Q4_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0 פתוח ומסחרי. מותר להריץ, לשנות, להטמיע במוצרים סגורים ולמכור גישה ללא תשלום תמלוגים לגוגל או לאנפלאות'. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗