GPT
G

GLM-5.3-Flash-tr3-4bpw

קוד פתוח

brandonmusicother2026-08-27

  • transformers
  • safetensors
  • glm5_next
  • image-text-to-text
  • glm

גרסה מכווצת בארבעה ביטים של מודל ענק עם שמונים ושמונה מיליארד פרמטרים. היא מיועדת למי שמחזיק שרתי עיבוד ייעודיים ורוצה מהירות פענוח גבוהה בלי לשלם על דיוק מלא.

  • 88Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 164 GBמשקל הקבצים
  • 8,603הורדות בחודש

מה זה

מדובר בהמרה של מודל שפה ומולטימדיה רב מומחים שמסוגל לקבל טקסט ותמונות. המטרה כאן היא לדחוס מודל של שמונים ושמונה מיליארד פרמטרים למבנה של ארבעה ביטים, תוך שימוש במנגנון שמאפשר יצירת טקסט ספקולטיבית ומהירה. החלון התיאורטי שלו מגיע למיליון טוקנים, אבל בפועל המימוש הזה מוגבל להקשרים קצרים יותר לפי תצורת הריצה שתבחרו.

המספרים מראים קצב פענוח נקי של מעל מאה וארבעים טוקנים בשנייה ומהירות קריאת הקשר של יותר מששת אלפים טוקנים בשנייה. מנגנון הניחוש מגיע לקבלת מעל חמישה טוקנים בכל צעד במשימות חשיבה, מה שמסביר את המהירות הגבוהה. עם זאת, הדחיסה מורגשת ביציבות הפלט, ובמבחני איכות מסוימים נרשמו נפילות ברורות לעומת מודל המקור.

מתאים ל

  • פתרון בעיות מתמטיות

    מנגנון הניחוש מקבל שיעור גבוה של טוקנים במשימות חשיבה, מה שמייצר מענה מהיר מאוד לחילוץ חישובים.

  • שירות טקסט רב משתמשים

    במצב מבוסס מנגנון פנימי ללא תמונות, המערכת מפנה זיכרון ומאפשרת טיפול במספר גדול של שיחות במקביל.

  • קריאת מסמכים ארוכים

    קצב הטעינה של עשרות אלפי טוקנים עובר את ששת אלפים טוקנים בשנייה ומאפשר עיבוד מהיר של טקסט רב.

איפה זה נופל

הדחיסה המאסיבית של הזיכרון פוגעת באמינות. במבחן האיכות המחמיר שנערך למודל עם מנגנון זיכרון מכווץ, הוא קיבל רק שלוש מתוך עשר תשובות ונכשל במדד הסף. המודל מתקשה לשמור על דיוק כשמבקשים ממנו עבודה עדינה.

בנוסף, יש צוואר בקבוק של קיבולת. במצב שכולל תמונות, הזיכרון המוקצה מאפשר רק פנייה אחת מלאה בו זמנית של תשעים ושמונה אלף טוקנים, וכל השאר נכנסות לתור. מי שבונה על מיליון טוקנים יגלה שהמערכת נחנקת הרבה קודם.

שאלות
נפוצות

אפשר להריץ את המודל על ספריית וי אל אל אם רגילה?

לא. המודל דורש גרסה מותאמת אישית של המנוע ואינו נתמך בספריות הרשמיות. כדי להרים אותו צריך להשתמש בקובצי הדוקר ובתסריטי ההרצה הייעודיים שסופקו יחד איתו.

האם המודל באמת תומך במיליון טוקנים בפועל?

על הנייר כן, אבל החומרה מגבילה אתכם הרבה קודם. בתצורת תמונות תקרת הפנייה היא פחות ממאה אלף טוקנים בגלל מגבלות זיכרון, ורק במצב טקסט מצומצם אפשר לגרד קיבולת גבוהה יותר.

אפשר להשתמש במודל הזה למוצר מסחרי?

זה מורכב. המודל עצמו דורש ייחוס מוגדר, אבל אם מריצים אותו יחד עם מודל ההאצה החיצוני כדי לקבל את הביצועים המובטחים, אתם כפופים לרישיון שאוסר שימוש מסחרי.

איך מריצים

אי אפשר להריץ את זה על מחשב אישי רגיל. הבדיקות נערכו על שני כרטיסי מסך מסוג בלקוול עם תשעים ושישה גיגה בייט זיכרון לכל אחד, במעטפת כוח של שלוש מאות עד שש מאות וואט. הקבצים שוקלים מאה שישים וארבעה גיגה בייט ומחולקים למאות חלקים. ההרצה דורשת תמונת דוקר ייעודית עם התאמות מיוחדות ולא עובדת עם ספריות סטנדרטיות ישר מהקופסה.

יש שלוש תצורות שירות: תמיכה בתמונות עם מודל האצה חיצוני, טקסט בלבד עם אותו מודל חיצוני, או טקסט בלבד עם מנגנון פנימי. התצורה האחרונה מוותרת על קלט תמונה אבל מפנה המון מקום בזיכרון ומאפשרת לשרת פי עשרה יותר פניות במקביל. אם אין לכם חומרה ייעודית כזו בענן פרטי, עדיף להשתמש בממשק מרוחק.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="brandonmusic/GLM-5.3-Flash-tr3-4bpw")
print(pipe("שלום"))

הקבצים

629 קבצים במאגר, 164 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון ספציפי בשם שאפלי אם סי ג'י גרסה אחת. כל נגזרת שלו חייבת לציין במפורש את שם הרישיון והקישור אליו. אם אתם משלבים את מודל ההאצה החיצוני כדי לקבל מהירות, הוא מגיע תחת רישיון נפרד שאוסר שימוש מסחרי, כך שכל השילוב הופך ללא מסחרי בעליל.

הרישיון המלא בעמוד המודל ↗