GPT
G

gemma-3n-E4B-it-GGUF

קוד פתוח

unslothgemma2025-06-26

  • transformers
  • gguf
  • gemma3
  • unsloth
  • gemma

גרסת קוונטיזציה של מודל מולטימודלי קומפקטי מגוגל, שפותחה כדי לאפשר שימוש קל על חומרה מקומית. הפתרון מתאים למי שרוצה ביצועים של 4B עם טביעת זיכרון מצומצמת בטקסט ובתמונה.

  • 115 GBמשקל הקבצים
  • 15,427הורדות בחודש
  • 206לייקים

מה זה

מדובר במודל שפותח על ידי Google DeepMind והומר לפורמט GGUF על ידי Unsloth. המודל בנוי על טכנולוגיית הפעלה סלקטיבית של פרמטרים, מה שמאפשר לו להחזיק גודל אפקטיבי של 4 מיליארד פרמטרים בזמן ריצה ולדרוש פחות משאבים ממודלים רגילים בעלי נפח דומה.

בבסיסו הוא תומך בעיבוד רב־ערוצי של טקסט, תמונה, וידאו ושמע עם חלון הקשר של 32K טוקנים. במבחני קוד כמו HumanEval הוא מציג דיוק של 75.0% בגרסת ההוראות, ובמבחן ההיגיון הרב־ברירתי MMLU הוא מגיע ל־64.9%, נתונים סבירים מאוד לגודל כזה של פרמטרים שמתאימים למשימות עזר מקומיות.

מתאים ל

  • עוזר שיחה וסיכום מקומי

    חלון הקשר של 32K מאפשר לקרוא מסמכים ארוכים ולסכם אותם ישירות על המחשב.

  • השלמת קוד בסיסית

    תוצאה של 75.0% ב־HumanEval הופכת אותו לפתרון יעיל לכתיבת פונקציות קצרות.

  • בדיקות ואימון עדין

    שימוש בטביעת זיכרון נמוכה לבניית שירותים מותאמים אישית ללא עלויות חומרה.

איפה זה נופל

החולשה העיקרית במאגר הזה היא שהקובץ הנוכחי תומך בטקסט בלבד ולא מנצל את יכולות התמונה והשמע של המודל המקורי. בנוסף, במשימות היגיון ומדע מורכבות המודל מתקשה, עם 23.7% בלבד במבחן GPQA Diamond ו־11.6% במבחן המתמטיקה AIME 2025. בסיס הידע שלו מוגבל ליוני 2024 והוא אינו מאגר עובדות אמין לשאלות ידע ספציפיות.

שאלות
נפוצות

האם אפשר להעביר למודל הזה קבצי תמונה ושמע?

לא בגרסה הזו. למרות שהמודל המקורי מולטימודלי, דף המודל של Unsloth מדגיש שכרגע נתמך קלט של טקסט בלבד.

איך הכי פשוט להריץ אותו על המחשב?

דרך Ollama בעזרת הפקודה עם תגית Q4_K_XL, שדואגת להגדיר לבד את תבנית הצ'אט הנכונה.

האם המודל יודע לענות על שאלות מתמטיות קשות?

לא כדאי להסתמך עליו בזה. במבחן AIME 2025 הוא קיבל ציון של 11.6% בלבד, כך שהיכולת שלו מוגבלת לחישובים פשוטים יחסית.

איך מריצים

כרגע דף המודל מציין תמיכה בהרצת טקסט בלבד בגרסה הזו, למרות שהארכיטקטורה המקורית מולטימודלית. אפשר להריץ אותו דרך Ollama בפקודה ישירה לגרסת ה־Q4_K_XL, או באמצעות ספריית transformers מגרסה 4.53.0 ומעלה, כשחשוב לשמור על תבנית הצ'אט הייעודית והגדרות יצירה כמו טמפרטורה 1.0 ו־top_k של 64.

הריצה המקומית קלה וחסכונית בזיכרון, במיוחד בגרסאות מכווצות של 4 ביט שלא דורשות מאיץ יקר. אם אתם חייבים עיבוד שמע או וידאו מורכב שלא נתמך עדיין בצורה יציבה במימושי ה־GGUF האלה, תעדיפו לפנות ל־API בענן.

ollama run hf.co/unsloth/gemma-3n-E4B-it-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל כפוף לרישיון התנאים של Gemma מטעם גוגל. הוא מאפשר שימוש חופשי ופיתוח מסחרי, אך כולל חובת עמידה במדיניות השימוש ההוגן ובבדיקות בטיחות שגוגל מגדירה למוצרי קצה.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗