GPT
G

GLM-4.7-Flash-NVFP4

קוד פתוח

GadflyIIapache-2.02026-01-19

  • transformers
  • safetensors
  • glm4_moe_lite
  • text-generation
  • moe

גרסת קוונטיזציה מכווצת במיוחד של מודל תערובת מומחים, שמיועדת למעבדי אנבידיה תומכי פורמט ארבע ביט. היא מאפשרת להריץ חלון הקשר עצום על חומרה מקומית בלי לאבד את רוב הדיוק של מקור.

  • 18Bפרמטרים
  • 202,752טוקנים בהקשר
  • 19.1 GBמשקל הקבצים
  • 16,965הורדות בחודש

מה זה

מדובר בהמרה של GLM-4.7-Flash למבנה מעורב בפורמט NVFP4. במקום לכווץ את הכל בצורה אחידה, המפתח השאיר את שכבות תשומת הלב והנורמליזציה ברמת BF16, ודחס רק את המומחים של הראוטינג לרמת ארבע ביט. הדבר הזה חותך את נפח הקבצים משישים ושניים גיגה בערך לעשרים גיגה בלבד, מה שמאפשר הרצה בכרטיס בודד של עשרים וארבעה גיגה.

התוצאה של השיטה הזו ברורה במספרים של מדד MMLU-Pro. קוונטיזציה רגילה ואחידה בארבע ביט ריסקה את התוצאה של המודל המקורי מ־24.83% ל־16.84%, שזו נפילה שהופכת אותו לבלתי שמיש. הגרסה הזו מגיעה ל־23.55%, כלומר ירידה של אחוז ורבע בלבד ביכולת לעומת המקור הלא מכווץ, תמורת חיסכון של פי שלושה בנפח הזיכרון.

מתאים ל

  • עיבוד מסמכים ארוכים באנגלית

    ניתוח טקסטים גדולים עם חלון הקשר נרחב, על גבי כרטיס גרפי יחיד שתומך בפורמט הדחיסה.

  • הסקה מהירה מקומית

    שימוש בארכיטקטורת מומחים שבה רק חלק קטן מהפרמטרים פעיל בכל טוקן, לקבלת מהירות תגובה גבוהה.

  • פתרונות ארגוניים מבודדים

    הרצה מקומית מלאה ללא תלות בענן חיצוני, בייחוד למשימות שאינן דורשות תכנות מורכב.

איפה זה נופל

המודל אומן ותומך רשמית בשתי שפות בלבד, אנגלית וסינית, כך שאינו מיועד לעבודה שוטפת בעברית. הירידה בדיוק אינה אחידה בכל התחומים, וכשבוחנים את נתוני המבחנים רואים שבמדעי המחשב הביצועים צנחו ביותר מארבעה וחצי אחוזים לעומת מודל המקור. בנוסף, חלון ההקשר המלא של מאתיים אלף טוקנים ידרוש זיכרון עבודה נרחב עבור ה־KV cache, מה שלא יתאפשר בפועל על כרטיס בודד למרות הדחיסה של המשקולות עצמן.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיסי מסך ישנים יותר?

לא מומלץ. המודל דורש תמיכת חומרה בליבות טנסור עבור FP4, שקיימת רק בארכיטקטורות של Ada Lovelace, Hopper ו־Blackwell. על חומרה מדורות קודמים הוא לא יוכל לנצל את היתרונות הטכניים של הפורמט הזה.

האם הוא מתאים לכתיבת קוד?

הנתונים מראים פגיעה מורגשת ביכולות האלה. מתוך כל הנושאים שנבדקו במבחן MMLU-Pro, מדעי המחשב ספגו את הירידה הגדולה ביותר בדיוק, כמעט פי ארבעה משאר התחומים שנבדקו.

איך מריצים

כדי להריץ אותו צריך גרסת vLLM מגרסה 0.14.0 ומעלה שכוללת תמיכה ב־compressed-tensors, וספריית transformers מגרסה חמש ומעלה. החומרה חייבת לתמוך בליבות טנסור של FP4, כמו כרטיסי Blackwell, Hopper או Ada Lovelace. מי שמחזיק מערכות מרובות כרטיסים מדור בלקוול צריך כרגע להשתמש בפורק ייעודי של vLLM שמספק המפתח, עקב תקלות תקשורת בין כרטיסים שעדיין מחכות למיזוג רשמי.

אם יש לכם כרטיס RTX תואם עם 24GB זיכרון, הוא ירוץ אצלכם ישירות בלי חלוקה לכמה כרטיסים. אם אין לכם חומרה כזו מהשנים האחרונות או שאתם צריכים לפתוח את כל מאתיים אלף הטוקנים של חלון ההקשר, הזיכרון פשוט ייגמר מהר מאוד ועדיף לפנות לשירותי ענן.

from transformers import pipeline

pipe = pipeline("text-generation", model="GadflyII/GLM-4.7-Flash-NVFP4")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון apache-2.0 סטנדרטי וחופשי. אפשר להשתמש בו לצרכים מסחריים, לשנות אותו, להריץ אותו בשרתים פרטיים ולשלב אותו במוצרים מסחריים בלי לשלם תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗