GPT
G

gemma-4-12B-it-OptiQ-4bit

קוד פתוח

mlx-communitygemma2026-06-05

  • mlx
  • safetensors
  • gemma4_unified
  • quantized
  • mixed-precision

גרסת MLX מקווצת של Gemma 4 בגודל 12B, שמיועדת למחשבי אפל. היא משלבת 4 ו־8 ביט כדי לשמור על דיוק בקוד ובחשיבה בלי לשקול כמו מודל מלא.

  • 12Bפרמטרים
  • 131,072טוקנים בהקשר
  • 8.4 GBמשקל הקבצים
  • 3,247הורדות בחודש

מה זה

מדובר בהמרה של המודל האחוד של גוגל שמיועדת לספריית MLX, אבל היא מטפלת בטקסט בלבד. רכיבי התמונה והאודיו המקוריים הוסרו בתהליך, כך שנשארתם רק עם מנוע שפה וחשיבה.

במקום לקווץ את כל השכבות באותה צורה, השתמשו בכיול שמשאיר 156 שכבות רגישות ב־8 ביט ומוריד 172 שכבות עמידות ל־4 ביט, עם ממוצע של 5.22 ביט למשקל. במבחנים זה מורגש בעיקר בקוד ובשליפת מידע מהקשר ארוך, שם נמדדו קפיצות ביצועים של מעל עשרה אחוזים לעומת קיווץ אחיד של 4 ביט. מצד שני, קריאות לפונקציות לא מראות שום שיפור, והתוספת בדיוק עולה בשני גיגה-בייט נוספים בדיסק.

מתאים ל

  • פיתוח וכתיבת קוד מקומית

    משיג 88.4 אחוזים בבדיקות קוד ומתאים למי שרוצה השלמות ופתרון תקלות מקומי בלי לשלוח שורות קוד לענן.

  • ניתוח מסמכים ארוכים

    חלון הקשר של 131,072 טוקנים עם שיפור מוכח בשליפת מידע לעומת קיווץ בסיסי.

  • משימות חשיבה והסקה

    כולל ערוץ חשיבה מובנה שעוזר לו להגיע ליותר מ־93 אחוזים בבעיות היגיון ומתמטיקה.

איפה זה נופל

החיסרון המרכזי הוא הוויתור על יכולות המולטימדיה. אם הורדתם את גרסת הבסיס מתוך מחשבה לנתח צילומי מסך או קבצי קול, ההמרה הזו חתכה אותם לחלוטין. בנוסף, בבנצ'מרק MMLU המודל קיבל 42.6 אחוזים בלבד, והתוצאות בקריאות לפונקציות לא השתפרו כלל לעומת קיווץ רגיל. בעבודה עם משימות פשוטות כמו מיון או חילוץ מידע צריך לכבות ידנית את ערוץ החשיבה, אחרת הוא יבזבז זמן וטוקנים על שלבי מחשבה מיותרים.

שאלות
נפוצות

האם המודל תומך בתמונות או בקבצי קול כמו גרסת המקור?

לא. בתהליך ההמרה ל־MLX הסירו את חלקי הוויז'ן והאודיו כדי לחסוך מקום, והשאירו רק את רכיב הטקסט. אם אתם צריכים קלט רב-ערוצי, הגרסה הזו לא תעבוד.

למה ההתקנה נכשלת עם גרסת mlx-lm הרגילה?

הארכיטקטורה של Gemma 4 Unified עדיין לא נכנסה להפצה הרשמית של mlx-lm ב־PyPI. צריך להתקין את ספריית mlx-optiq ואת mlx-lm ישירות ממאגר הגיט, ולייבא את optiq בקוד כדי שהוא יזהה את המודל.

איך מונעים מהמודל לבזבז זמן על שלב החשיבה?

המודל מכיל ערוץ חשיבה מובנה שפועל כברירת מחדל. למשימות ישירות כמו תיוג או שליפת נתונים, שולחים את המאפיין enable_thinking שמוגדר כ־False בתבנית השיחה.

איך מריצים

המודל תופס 8.4 גיגה-בייט על הדיסק, כך שהוא דורש מק עם מעבד של אפל וזיכרון אחוד שמשאיר מקום סביר למשקלים ול־KV cache של ההקשר. אי אפשר להריץ אותו עם גרסת PyPI הרגילה של mlx-lm, אלא חייבים להתקין אותה ישירות מהמאגר בגיטהאב יחד עם חבילת mlx-optiq כדי לרשום את סוג המודל.

אם יש לכם מחשב עם 16 גיגה זיכרון לפחות וצריך להריץ משימות פיתוח מקומיות בלי תלות ברשת, שווה להריץ אותו אצלכם. אם אתם עובדים על מחשב אינטל, לינוקס, או צריכים לטפל באודיו ותמונה, עדיף לפנות ישירות ל־API של המודל המקורי.

pip install -U huggingface_hub
hf download mlx-community/gemma-4-12B-it-OptiQ-4bit

הרישיון

הפרויקט כפוף לרישיון של משפחת Gemma של גוגל, שעובר בירושה ממודל הבסיס. הרישיון מאפשר שימוש מסחרי, אבל מחייב עמידה בתנאי השימוש ובהגבלות הייעוד של גוגל. מי שמתכנן להפיץ אותו כחלק ממוצר צריך לוודא שהשימוש תואם את המדיניות הזו.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗