GPT
G

gemma-3n-E2B-it-GGUF

קוד פתוח

unslothgemma2025-06-26

  • transformers
  • gguf
  • gemma3
  • unsloth
  • gemma

גרסת קוונטיזציה מכווצת של גוגל שמפעילה בפועל רק 2 מיליארד פרמטרים. היא מיועדת למי שרוצה להריץ מודל שיחה מקומי על מחשב אישי או חומרה חלשה בלי לוותר על חלון הקשר של 32 אלף טוקנים.

  • 77.7 GBמשקל הקבצים
  • 16,909הורדות בחודש
  • 60לייקים

מה זה

גוגל ו־Unsloth בנו כאן מודל שמשתמש בהפעלה סלקטיבית של פרמטרים, כך שלמרות המשקל הכולל של הקבצים במאגר, בזמן ריצה הוא מתנהג ומגיב כמו מודל של 2 מיליארד פרמטרים בלבד. הוא אומן על 11 טריליון טוקנים ממגוון מקורות עם חיתוך ידע ביוני 2024, ומביא חלון הקשר של 32K טוקנים שמתאים לניתוח טקסטים בינוניים.

במבחני הביצועים רואים בדיוק את הפשרות של הגודל הזה. בבדיקות ידע כללי והבנת טקסט בסיסית כמו TriviaQA הוא מגיע ל־60.8 אחוז דיוק, אבל במשימות קשות יותר כמו Natural Questions הוא צונח ל־15.5 אחוז. בקוד הוא מצליח לעבור 66.5 אחוז במבחן HumanEval הפשוט, אך במבחן מעשי כמו LiveCodeBench הוא עומד על 18.6 אחוז בלבד. זה כלי שמבין הוראות ישירות, אך מתקשה מאוד בחשיבה לוגית עמוקה.

מתאים ל

  • בוט שיחה מקומי

    פועל על חומרה בסיסית ומחזיר מענה מהיר בהקשר של עד 32 אלף טוקנים.

  • תמצות טקסטים ומסמכים

    מחלץ מידע ומסכם פסקאות ארוכות ביעילות בלי לשלוח מידע לרשת חיצונית.

  • השלמת קוד בסיסית

    מייצר פונקציות קצרות ופשוטות ישירות בסביבת הפיתוח המקומית.

איפה זה נופל

למרות שהארכיטקטורה המקורית של גוגל תומכת בקלט של תמונה ושמע, כרטיס המודל מבהיר שבגרסה הזו נתמך טקסט בלבד. במשימות מתמטיקה מורכבות המודל חלש במיוחד, עם תוצאה של 6.7 אחוז בלבד במבחן AIME 2025. מעבר לכך, במבחני שפה שאינם אנגלית כמו MMLU ProX הוא משיג 8.1 אחוז, מה שאומר שאי אפשר לסמוך עליו בעברית ללא בדיקה מעמיקה של הזיות.

שאלות
נפוצות

האם אפשר לשלוח למודל תמונות או קבצי שמע?

לא בגרסה הזו. המפרסם מציין מפורשות שכרגע נתמך קלט טקסט בלבד, למרות שמודל המקור אומן כמולטימודלי.

כמה זיכרון דרוש כדי להריץ אותו?

מכיוון שמדובר במודל שמפעיל רק 2 מיליארד פרמטרים, קובץ קוונטיזציה בודד תופס גיגהבייטים בודדים ויכול לרוץ על כמעט כל כרטיס מסך ביתי או מחשב נייד מודרני.

האם המודל מתאים לפיתוח תוכנה מורכב?

לא. התוצאות שלו במבחני קידוד מתקדמים עומדות סביב 18 אחוז, כך שהוא מתאים בעיקר להשלמות תחביר פשוטות ולא לתכנון מערכות.

איך מריצים

ההרצה המקומית מתבצעת בעיקר דרך Ollama או ספריות GGUF תואמות, תוך שימוש בתבנית השיחה המדויקת של גוגל ופרמטרים מומלצים של טמפרטורה 1.0 ו־top_p של 0.95. המאגר כולל 29 קבצים ששוקלים יחד 77.7 גיגהבייט עבור כל הגרסאות הדינמיות, אך בפועל מורידים קובץ כיול בודד לפי כמות הזיכרון הפנויה אצלכם.

גרסת ה־2B דורשת מעט מאוד משאבים ומסוגלת לרוץ היטב על מעבדים גרפיים צנועים ואפילו על מעבד מרכזי בלבד עם כמה גיגהבייטים בודדים של זיכרון. אם המטרה היא דיוק גבוה בלוגיקה מורכבת או משימות קוד כבדות, עדיף לפנות ל־API של מודל ענן גדול, שכן הגודל הזה פשוט לא יספק את הסחורה.

ollama run hf.co/unsloth/gemma-3n-E2B-it-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

השימוש כפוף לרישיון הייעודי של גוגל ממשפחת Gemma. מותר להשתמש בו ליישומים מסחריים ומחקר, אך הרישיון מחייב עמידה במדיניות השימוש והבטיחות של גוגל, לצד תנאי הפצה ספציפיים שמונעים שימושים פוגעניים מסוימים.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗