GPT
G

gemma-4-E4B-it-UD-MLX-4bit

קוד פתוח

unslothapache-2.02026-04-02

  • safetensors
  • gemma4
  • unsloth
  • gemma
  • google

גרסת קוונטיזציה של 4 ביט למודל קומפקטי שמיועד למחשבי מק עם שבבי אפל סיליקון. הוא משלב עיבוד תמונה וקול בתוך חבילה רזה שרצה מקומית בלי לבלוע את הזיכרון.

  • 2Bפרמטרים
  • 131,072טוקנים בהקשר
  • 6.2 GBמשקל הקבצים
  • 4,807הורדות בחודש

מה זה

הגרסה הזו מכווצת את המודל של גוגל באמצעות MLX, כך שהוא תופס רק 6.2 גיגה בייט ומיועד ישירות להרצה על מק. למרות גודל של כשני מיליארד פרמטרים אפקטיביים, הוא כולל יכולת עיבוד של טקסט, תמונה ואודיו, ומציע חלון הקשר של 128 אלף טוקנים. השימוש בטבלאות שיכון לכל שכבה שומר על דרישות חישוב נמוכות ביחס לגודלו הכולל.

במדדים, גודל ה־E4B מציג 69.4 אחוז ב־MMLU Pro וציון של 52 ב־LiveCodeBench. התוצאות האלה מראות שהוא מתאים למשימות קוד ושיחה בסיסיות, אבל במבחני חשיבה מורכבים כמו AIME הוא נופל לאזור ה־42.5 אחוז. הוא חזק משמעותית מהדור הקודם באותו סדר גודל, אך עדיין מוגבל לעומת הגרסאות הגדולות של המשפחה.

מתאים ל

  • תמלול אודיו קצר במק

    זיהוי דיבור מקומי לקטעי קול של עד חצי דקה ישירות מהמעבד של אפל בלי לשלוח שום מידע לענן.

  • פענוח מסמכים ותמונות

    חילוץ טקסט וניתוח גרפים מקובצי תמונה באמצעות תקציב טוקנים ויזואלי מותאם לחומרה חלשה.

  • עוזר קוד מקומי ופשוט

    השלמת קוד בסיסי ותיקון שגיאות תחביר בסביבת פיתוח מנותקת מרשת בלי להעמיס על המחשב.

איפה זה נופל

היכולות במשימות קשות מוגבלות מאוד. במבחן AIME ללא כלים הוא מקבל 42.5 אחוז בלבד, ובדירוג Codeforces הוא עומד על 940, כך שאי אפשר לסמוך עליו לתכנות אלגוריתמי עמוק או לפתרון בעיות מתמטיות סבוכות. בנוסף, חלון ההקשר הארוך לא מפצה על ביצועים ירודים באחזור מידע, ובמדד MRCR למציאת מידע בטקסט ארוך הוא פוגע רק ב־25.4 אחוז מהמקרים. קובצי אודיו מוגבלים ל־30 שניות ווידאו עד דקה אחת בלבד.

שאלות
נפוצות

האם אפשר להריץ את הגרסה הזו על מחשב עם ווינדוס וכרטיס של אנבידיה?

לא, קובצי MLX בנויים ספציפית עבור הפריימוורק של אפל סיליקון ורצים על מק בלבד. לחומרה אחרת צריך לחפש גרסאות בפורמט GGUF או משקלים רגילים ל־Transformers.

האם המודל יזכור שיחות שלמות של 128 אלף טוקנים בלי לאבד מידע?

חלון ההקשר תומך בנפח הזה מבחינה טכנית, אבל במבחני אחזור מורכבים הוא משיג רק 25.4 אחוזי דיוק. לא כדאי להסתמך עליו לחיפוש פרטים עדינים בתוך קבצים ענקיים.

איך מריצים

ההרצה נעשית באמצעות ספריית mlx_vlm ישירות מהטרמינל בסביבת פייתון ייעודית למק. מורידים את סקריפט ההתקנה של Unsloth ומפעילים את פקודת הצ'אט שמפנה ישירות למזהה המודל. אין צורך בשרתים מרוחקים או בציוד יקר, מחשב מק מודרני עם זיכרון משותף בסיסי יספיק פה.

אם אתם צריכים לפתור בעיות היגיון מורכבות במיוחד או להריץ קוד כבד, המודל הזה קטן מדי, ועדיף לשלוח קריאות API למודלים הגדולים של 26B או 31B. ההרצה המקומית בגרסה הזו שווה את המאמץ בעיקר כשאתם חייבים עיבוד קול ותמונה מקומי ופרטי בלי תלות ברשת.

pip install -U huggingface_hub
hf download unsloth/gemma-4-E4B-it-UD-MLX-4bit

הרישיון

המודל משוחרר תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד, הפצה ושילוב בתוך מוצרים פרטיים או מסחריים בלי תשלום תמלוגים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים וציון השינויים שבוצעו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗