GPT
G

GLM-4.7-Flash-4bit

קוד פתוח

mlx-communitymit2026-01-19

  • mlx
  • safetensors
  • glm4_moe_lite
  • text-generation
  • conversational

גרסה מכווצת של מודל ענק עם חלון של מעל 200 אלף טוקנים, שמתאימה למי שרוצה להריץ טקסטים ארוכים מקומית על אפל סיליקון בלי לחנוק את המחשב.

  • 30Bפרמטרים
  • 202,752טוקנים בהקשר
  • 15.7 GBמשקל הקבצים
  • 7,576הורדות בחודש

מה זה

מדובר בהמרה בכימות של 4 ביט של מודל המבוסס על ארכיטקטורת תערובת מומחים, Glm4MoeLiteForCausalLM, עם כמעט 30 מיליארד פרמטרים ו־47 שכבות. הוא מכוון ספציפית ליצירת טקסט באנגלית ובסינית, ורץ דרך ספריית mlx ישירות על החומרה של אפל.

היתרון המרכזי כאן הוא חלון הקשר עצום של 202,752 טוקנים שנכנס לקבצים במשקל כולל של 15.7 ג'יגה בייט בלבד. ארכיטקטורת המומחים מפעילה רק חלק מהמשקלים בכל רגע נתון, כך שמקבלים יכולת התמודדות עם נפח נתונים של מודל גדול, אבל בדרישות זיכרון נמוכות בהרבה לעומת מודלים צפופים בגודל הזה.

מתאים ל

  • עיבוד מסמכים ארוכים

    חלון של 202,752 טוקנים מאפשר לקרוא ספרים או קבצי קוד שלמים באנגלית ובסינית על המק.

  • עבודה מקומית באנגלית

    הרצה מקומית דרך mlx ללא שליחת מידע רגיש לשירותי ענן חיצוניים.

  • בניית שירותים מסחריים

    רישיון mit פוטר מסיבוכים משפטיים ומאפשר הטמעה חופשית בכל מערכת מסחרית.

איפה זה נופל

הכרטיס מציין תמיכה בשתי שפות בלבד, אנגלית וסינית. עברית לא רשומה כשפה נתמכת, כך שסביר להניח שהוא יגמגם, ימציא מילים או יסרב לענות בעברית תקינה בלי כוונון ייעודי. בנוסף, מדובר בכימות של 4 ביט למודל MoE, מה שמוריד מאיכות התשובות ומהדיוק בניואנסים לעומת משקלים מלאים. אם אתם בונים מוצר שדורש אמינות גבוהה או תמיכה מקומית בעברית, חובה לבדוק אותו ביסודיות לפני שסומכים עליו.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה בעברית?

המודל הוגדר רשמית עבור אנגלית וסינית בלבד. הוא לא אומן לעברית, ולכן לא מומלץ להסתמך עליו לפרויקטים בשפה זו.

האם הוא יעבוד על כרטיס מסך של Nvidia או במחשב ווינדוס?

לא ישירות מהחבילה הזו. הקבצים האלה הומרו באמצעות mlx-lm ומיועדים לפעול בספריית mlx שרצה אך ורק על גבי אפל סיליקון.

איך מריצים

כדי להריץ אותו מתקינים את ספריית mlx-lm וטוענים את המשקלים ישירות בקוד פייתון. המודל שוקל 15.7 ג'יגה בייט ב־12 קבצים, מה שאומר שאתם חייבים מחשב מק עם זיכרון מאוחד שיכול להחזיק את הקבצים האלה ועדיין להשאיר מקום לפעולת המערכת.

אם יש לכם מק עם מעט זיכרון, או שאתם מתכננים למלא את כל 202,752 הטוקנים של ההקשר, תצטרכו הרבה יותר מקום עבור זיכרון העבודה. במצב כזה, או אם אין לכם חומרת מק בכלל, עדיף לפנות ל־API חיצוני שמחזיק את המודל במקום להילחם עם החומרה המקומית.

pip install -U huggingface_hub
hf download mlx-community/GLM-4.7-Flash-4bit

הרישיון

המודל מופץ תחת רישיון mit. זה הרישיון הכי מתירני שיש, ומותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו בקוד סגור, בלי דרישה לתמלוגים ועם חובה פשוטה לצרף את הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗