GPT
G

gemma-4-12b-coder-fable5-composer2.5-4bit

קוד פתוח

mlx-communityapache-2.02026-06-19

  • mlx
  • safetensors
  • gemma4_unified
  • image-text-to-text
  • gemma4

גרסת 4 ביט של מודל קוד מבוסס Gemma שמותאמת במיוחד לעבודה מקומית על מחשבי מק. הוא נדחס לגודל של 6.3 גיגה כדי שתוכלו לקודד איתו בלי לשלם על שרתי ענן.

  • 12Bפרמטרים
  • 262,144טוקנים בהקשר
  • 6.3 GBמשקל הקבצים
  • 9,604הורדות בחודש

מה זה

מדובר בהמרה של כוונון עדין למודל Gemma 4 בגודל 12 מיליארד פרמטרים, שנועד למשימות תכנות והסקה לוגית. ההבדל המרכזי כאן הוא ההתאמה הישירה לספריית MLX של אפל ודחיסת 4 ביט, שחותכת את דרישות הזיכרון ומאפשרת להריץ מודל חשיבה וכתיבת קוד על חומרה יומיומית.

המשקל הכולל ירד ל־6.3 גיגה בעשרה קבצים, והמפתחים הוסיפו לו תבנית צ'אט מסוג Jinja כדי שהשיחה בפורמט שאלות ותשובות תרוץ חלק בלי לשבור את המבנה. המודל מחזיק חלון הקשר ענקי של 262,144 טוקנים, כך שאפשר תיאורטית להזין לתוכו קבצי קוד ארוכים או ספריות שלמות בניתוח מקומי.

מתאים ל

  • פיתוח מקומי במק

    משקל של 6.3 גיגה מתאים לעבודה שוטפת בתוך מחשב נייד בלי לפתוח חיבור לרשת חיצונית.

  • בדיקת קוד ארוך

    חלון הקשר של 262 אלף טוקנים מאפשר לבחון קבצים שלמים או סקריפטים מורכבים במכה אחת.

  • עוזר שיחה לתכנות

    תבנית Jinja מובנית מייצרת אינטראקציה פשוטה של שאלות ותשובות דרך ספריית mlx-lm.

איפה זה נופל

הכרטיס טוען ליכולות קוד והסקה כמעט ללא אובדן איכות, אבל מדובר עדיין בכימות של 4 ביט. דחיסה כזו עלולה לייצר באגים קטנים, הזיות בתחביר של ספריות נידחות ואי-דיוקים שלא קיימים בגרסת המקור המלאה.

בנוסף, הכרטיס לא מספק שום מבחני ביצועים רשמיים, השוואות או ציוני בנצ'מרק, כך שאי אפשר לדעת מראש איך הוא מתפקד בעברית, עד כמה הוא יעיל מול שפות תכנות שאינן פייתון, או איך הוא מחזיק הקשר באמת ארוך. תצטרכו לבדוק את הקוד שלו ידנית לפני שאתם סומכים עליו במשהו רגיש.

שאלות
נפוצות

אפשר להריץ את המודל הזה על כרטיס מסך של Nvidia?

לא. המודל עבר הסבה וכימות עבור ספריית MLX, שפותחה במיוחד ועובדת אך ורק על מעבדי Apple Silicon במחשבי מק. אם יש לכם מחשב מבוסס לינוקס, חלונות או חומרה של Nvidia, תצטרכו לחפש גרסה בפורמט אחר כמו GGUF או את מודל המקור.

האם המודל תופס רק 6.3 גיגה מהזיכרון בזמן עבודה?

הקבצים עצמם שוקלים 6.3 גיגה בדיסק, וזה הזיכרון הבסיסי שדרוש כדי לטעון את המשקולות. עם זאת, ברגע שתתחילו לנצל את חלון ההקשר הגדול ולהזין עשרות אלפי טוקנים, צריכת ה־RAM תעלה בצורה חדה. למשימות קצרות 16 גיגה יספיקו, אבל להקשר עמוק תצטרכו יותר.

איך מריצים

כדי להריץ אותו צריך מק עם מעבד אפל סיליקון, להתקין את ספריית mlx-lm בפייתון, ולטעון אותו ישירות מהמזהה ברשת. המשקל של הקבצים עומד על 6.3 גיגה, כך שמק עם 16 גיגה זיקרם משותף יתמודד איתו בלי להיחנק, בתנאי שלא מעמיסים על ההקשר עד הקצה.

אם אתם על חלונות או לינוקס, אין לכם מה לחפש פה כי הפורמט הזה נעול לחלוטין למערכת האקולוגית של אפל. בנוסף, חלון של 262 אלף טוקנים ידרוש זיכרון עצום אם תנסו למלא אותו עד הסוף, ובמקרים של ניתוח פרויקטי ענק עדיף לשלם לפי טוקן ל־API בענן מאשר לטחון את המחשב הנייד.

pip install -U huggingface_hub
hf download mlx-community/gemma-4-12b-coder-fable5-composer2.5-4bit

הרישיון

הרישיון הוא Apache 2.0 מלא וחופשי. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד, לשלב אותו במוצר שלכם ולהפיץ אותו הלאה. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי תמלוגים ובלי הגבלות על קוד סגור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗