GPT
G

gemma-4-26B-A4B-it-qat-q4_0-gguf

קוד פתוח

googleapache-2.02026-05-01

  • transformers
  • gguf
  • image-text-to-text
  • endpoints_compatible
  • conversational

גרסת MoE מכווצת שמפעילה 3.8 מיליארד פרמטרים מתוך 25.2 בזמן ריצה. מתאימה למי שרוצה ביצועים של מודל גדול יחד עם מהירות תגובה גבוהה ודרישות חומרה נמוכות.

  • 14.6 GBמשקל הקבצים
  • 569,450הורדות בחודש
  • 164לייקים

מה זה

מדובר במודל מולטימודלי לעיבוד תמונה וטקסט שמבוסס על ארכיטקטורת תערובת מומחים, עם 8 מומחים פעילים מתוך 128 ועוד מומחה משותף אחד. הקובץ הנוכחי מכווץ בשיטת אימון מודע לכימוס ברמת 4 ביט, שנועדה לשמר את איכות המשקלים המקורית של bfloat16 בנפח קטן בהרבה. חלון ההקשר שלו נמתח עד 256 אלף טוקנים בעזרת שילוב של שכבות קשב מקומיות וגלובליות.

במדדי ההסקה הוא מציג תוצאות חזקות למדי. הוא מגיע ל־82.6% ב־MMLU Pro ולציון של 1718 ב־Codeforces, שמציבים אותו קרוב מאוד למודל ה־31B הדחוס למרות שהוא מפעיל שבריר מכוח החישוב בכל שלב. בעיבוד תמונה הוא רושם מרחק עריכה של 0.149 ב־OmniDocBench 1.5 ומגיע ל־82.4% ב־MATH-Vision, כך שהוא מתמודד היטב עם מסמכים וניתוח תרשימים.

מתאים ל

  • ניתוח מסמכים ו־OCR

    קריאת טקסט עמוס מתמונות ומסמכים בזכות תקציב טוקנים חזותי דינמי עד 1120.

  • סוכני קוד ואוטומציה

    הפעלת פונקציות מובנית ודירוג של 1718 ב־Codeforces מאפשרים כתיבת סקריפטים אמינה.

  • שרת מהיר לעומס גבוה

    מפעיל רק 3.8B פרמטרים לטוקן, מה שמייצר זמני תגובה קצרים גם בחומרה מוגבלת.

איפה זה נופל

המודל הזה אינו תומך בקלט אודיו, יכולת שקיימת רק בגרסאות הקטנות יותר ובמודל ה־12B של המשפחה. בסרטוני וידאו הוא מוגבל לעיבוד של עד 60 פריימים בודדים בקצב של פריים לשנייה, ללא סאונד. נקודת תורפה בולטת במיוחד היא מבחן HLE ללא כלים חיצוניים, שבו הוא צונח ל־8.7% בלבד לעומת 19.5% בגרסת ה־31B הדחוסה, כך שהוא יתקשה לענות על שאלות ידע מורכבות ללא חיפוש מקדים. כמו כן, בשיחות מרובות תורות חובה לנקות את טוקני החשיבה הקודמים מההיסטוריה כדי למנוע ירידה באיכות הפלט.

שאלות
נפוצות

האם המודל מסוגל לקבל קבצי שמע?

לא. תמיכה באודיו קיימת רק בדגמי E2B, E4B ו־12B. הגרסה הזו מוגבלת לטקסט ולתמונות בלבד.

מה היתרון של גרסת QAT על פני כימוס רגיל של 4 ביט?

הכימוס בוצע כבר במהלך שלב האימון עצמו. זה מאפשר למודל לשמור על רמת דיוק קרובה למשקלים המקוריים של bfloat16, תוך חיסכון ניכר בנפח הזיכרון.

איך מפעילים את מצב החשיבה המובנה?

מוסיפים את הטוקן המיועד בראש הנחיית המערכת. במצב זה המודל פולט את שרשרת הנימוקים שלו בתוך תגיות ייעודיות לפני שהוא מדפיס את התשובה הסופית.

איך מריצים

הקובץ שוקל 14.6 גיגה-בייט ומחולק לארבעה חלקים בפורמט GGUF, כך שקל לטעון אותו ישירות בכלי הרצה תואמים או בספריית transformers. כדי להריץ אותו בנוחות עם הקשר רחב צריך כרטיס מסך בעל 16 עד 24 גיגה-בייט של זיכרון ייעודי, או לחלופין מעבד מודרני עם מספיק זיכרון מערכת מאוחד. המודל רץ במהירות הדומה למודל של 4 מיליארד פרמטרים כי רק חלק קטן מהרשת פועל בכל טוקן.

אם אתם מתכננים להשתמש בחלון ההקשר המלא של 256K, הזיכרון הנדרש לקאש יזנק בצורה חדה. במקרים של עומסי עבודה כבדים עם קלטים ארוכים במיוחד, פנייה לנקודת קצה מנוהלת בענן תחסוך את עלויות החומרה המקומית ותספק יציבות גבוהה יותר.

ollama run hf.co/google/gemma-4-26B-A4B-it-qat-q4_0-gguf:gemma-4-26B-it-mmproj

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

4 קבצים במאגר, 14.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולהפיץ אותו כחלק ממוצר סגור בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים וכתב הוויתור על האחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗