GPT
G

GLM-4.7-Flash-AWQ-4bit

קוד פתוח

cyankiwimit2026-01-19

  • transformers
  • safetensors
  • glm4_moe_lite
  • text-generation
  • conversational

גרסה מכווצת בארבעה ביט למודל תערובת מומחים של שלושים ושניים מיליארד פרמטרים. היא נותנת ביצועים חזקים במיוחד בקוד ופתרון בעיות בלי לדרוש שרת מרובה כרטיסים ענק.

  • 32Bפרמטרים
  • 202,752טוקנים בהקשר
  • 18.8 GBמשקל הקבצים
  • 233,594הורדות בחודש

מה זה

מדובר בגרסת קוונטיזציה של מודל תערובת מומחים שמשתמשת רק בכשלושה מיליארד פרמטרים פעילים בכל רגע נתון. המטרה כאן היא לתת תפוקה של מודל גדול בהרבה, תוך שמירה על מהירות חישוב גבוהה שמתאימה לריצה מקומית. התוצאות במבחני הביצועים מציגות פער בולט לטובתו במשימות תכנות מעשיות, עם ציון של 59.2 במבחן SWE-bench Verified לעומת 22 בלבד של Qwen3 המקביל.

הוא כולל תמיכה מובנית בחלון הקשר ענקי של מעל מאתיים אלף טוקנים, מה שמאפשר לו לעבד מסמכים ארוכים או מאגרי קוד שלמים בבת אחת. במבחני סוכנים ואינטראקציה מורכבת מול ממשקים הוא מציג יתרון עקבי מול מודלים אחרים בקטגוריית הגודל הזו.

מתאים ל

  • תיקון באגים במאגרי תוכנה

    תוצאת שיא של 59.2 במבחן SWE-bench הופכת אותו למתאים לאיתור ותיקון שגיאות בקוד קיים.

  • סוכנים לאוטומציית ממשקים

    הוא משיג 79.5 במבחן τ²-Bench ומיועד להפעלת כלים וביצוע משימות רב שלביות.

  • ניתוח מסמכי ענק באנגלית

    חלון של מאתיים אלף טוקנים מאפשר לטעון תיקי מסמכים מלאים לצורך חיפוש ותמצות.

איפה זה נופל

השפות הנתמכות רשמית הן אנגלית וסינית בלבד, ולכן אין להסתמך עליו בעיבוד טקסט בעברית ללא בדיקה יסודית. במבחן הקוד LCB v6 הוא קיבל ציון 64 שנופל במעט מזה של Qwen3 המתחרה שעומד על 66. במבחן השאלות הקשות HLE התוצאה עומדת על 14.4 בלבד, מה שמראה כי חשיבה מופשטת ברמה גבוהה עדיין מוגבלת מאוד.

שאלות
נפוצות

האם המודל ירוץ בצורה חלקה על מחשב אישי עם כרטיס בודד?

הוא יכול להיטען על כרטיס של עשרים וארבעה גיגה זיכרון כמו שלוש מאות ותשעים או ארבע מאות ותשעים. עם זאת, ניצול חלון ההקשר המלא ידרוש כמות זיכרון גדולה בהרבה, ולכן בפועל תצטרכו להגביל את אורך השיחה.

איזו ספריה מומלצת להפעלת שרת מקומי שלו?

עדיף להשתמש בגרסאות הפיתוח העדכניות של vLLM או SGLang ישירות ממאגרי הקוד. שימו לב שהכרטיס דורש הגדרות פרסור ייעודיות לפקודות חשיבה וכלים כדי לנצל את מלוא יכולות הסוכן שלו.

איך מריצים

הקבצים שוקלים קצת פחות מתשעה עשר גיגהבייט, כך שכרטיס בודד של עשרים וארבעה גיגה זיכרון יכול להחזיק את המודל עצמו. הבעיה מתחילה ברגע שרוצים לנצל את חלון ההקשר המלא, שכן זיכרון המצב דורש נפח נוסף משמעותי שמחייב חומרה כבדה יותר או חלוקה לכמה כרטיסים.

ההרצה המקומית נתמכת דרך vLLM או SGLang, אך מחייבת שימוש בגרסאות פיתוח עדכניות מאוד ולא בהתקנות יציבות רגילות. אם אין לכם תשתית שרתים מנוהלת ומעודכנת, שימוש בנקודת הקצה הרשמית של Z.ai יחסוך את כאב הראש של תחזוקת הסביבה.

from transformers import pipeline

pipe = pipeline("text-generation", model="cyankiwi/GLM-4.7-Flash-AWQ-4bit")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון MIT. מדובר ברישיון מתירני שמאפשר שימוש מסחרי, שינוי קוד והפצה חוזרת במוצרים סגורים כמעט ללא הגבלה, למעט שמירת הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗