GPT
G

GLM-5.3-Flash-GGUF

קוד פתוח

unslothmit2026-08-26

  • gguf
  • unsloth
  • glm5_next
  • text-generation
  • en

גרסת GGUF מכווצת למודל מולטימודלי ענק של 320 מיליארד פרמטרים. היא פונה למי שרוצה ביצועי קוד וסוכנים ברמה גבוהה מקומית, אבל מפעיל בפועל רק 18 מיליארד פרמטרים בכל ריצה.

  • 2.3 TBמשקל הקבצים
  • 187,414הורדות בחודש
  • 393לייקים

מה זה

מדובר במודל שפותח במקור על ידי Z.ai ואומן מחדש על 30 טריליון טוקנים, כאשר צוות Unsloth ארז אותו בפורמט GGUF בעזרת טכנולוגיית הקוונטיזציה Dynamic 3.0 שלהם. המבנה שלו מבוסס על תערובת מומחים עם 320 מיליארד פרמטרים בסך הכל, שמתוכם רק 18 מיליארד מופעלים בפועל בכל טוקן, לצד ארכיטקטורה שמשלבת מנגנוני קשב ליניאריים ודלילים כדי להוזיל עיבוד בהקשר ארוך.

לפי נתוני המפתחים, השילוב הזה עוקף את GLM-5.2 בביצועים ומגיע לרמות שמגרדות את Claude Opus 4.8 במבחני קוד ומשימות סוכנים, כמו Terminal-Bench 2.1 וסביבות פיתוח מבוססות סוכן. הוא כולל תמיכה מובנית בראייה ובכלים מורכבים, ומסוגל להתמודד עם הקשרים ענקיים שנמדדו במבחנים עד 400 אלף ואף מיליון טוקנים בהזרמת נתונים ישירה.

מתאים ל

  • סוכני פיתוח אוטונומיים

    המודל מציג תוצאות גבוהות ב־Terminal-Bench ובסביבות סוכן, ומתאים לכתיבת קוד עצמאית.

  • ניתוח מסמכים ותמונות

    היכולות המולטימודליות וחלון ההקשר העצום מאפשרים עיבוד של קוד לצד צילומי מסך ותרשימים.

  • אוטומציה של כלים ומערכות

    נבדק בהרחבה על בנצ'מרקים של כלים כמו Toolathlon ומיועד לפעולות שדורשות קריאות API רציפות.

איפה זה נופל

המודל תומך באופן רשמי רק באנגלית ובסינית, כך שאין שום ערובה ליכולות שלו בעברית או בשפות אחרות. מעבר לכך, למרות שההרצה עצמה מפעילה רק 18 מיליארד פרמטרים, המשקל הכולל בזיכרון נגזר מכל 320 המיליארד, מה שיוצר צוואר בקבוק חומרתי קיצוני. המבחנים בכרטיס המודל נעשו עם הגבלות זמן של שש שעות למשימות קוד וניהול הקשר תוקפני, וזה מעיד על עומס חישובי כבד וזמני ריצה ארוכים בפועל.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב נייד רגיל?

לא. למרות שקיימת גרסת 1 ביט שמורידה את הדרישות, עדיין מדובר במודל של 320 מיליארד פרמטרים שדורש עשרות ומאות ג'יגה-בייט של זיכרון עבודה רק כדי להיטען.

למה כדאי להשתמש בגרסת ה־GGUF הזו במקום במודל המקורי?

הגרסה הזו משתמשת בדחיסת Dynamic 3.0 של Unsloth שממזערת את איבוד הדיוק בהשוואה למודל המלא. היא מאפשרת להריץ מודל ענק במשאבים מופחתים משמעותית ביחס למשקלים המקוריים.

איך מריצים

כדי להריץ אותו תצטרכו את גרסת ה־Desktop של Unsloth או ענף ייעודי מתוך PR 27754 של llama.cpp, כיוון שהארכיטקטורה דורשת תמיכה ספציפית שאינה קיימת בכלים ישנים. כלל הקבצים במאגר שוקלים 2.3 טרה-בייט ומכילים מגוון קוונטים, כולל גרסאות קיצוניות של 1 ביט להפעלה מקומית חסכונית.

משקל כזה דורש נפח אחסון עצום וזיכרון RAM או VRAM כבד מאוד גם בגרסאות הדחוסות ביותר. אם אין לכם תחנת עבודה ייעודית עם כרטיסי מסך חזקים או שרת מקומי מתאים, קריאה ל־API הרשמי של Z.ai תהיה זולה ופשוטה בהרבה מהרצה עצמאית.

ollama run hf.co/unsloth/GLM-5.3-Flash-GGUF:Q8_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

87 קבצים במאגר, 2.3 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המאגר מפורסם תחת רישיון MIT. זהו רישיון קוד פתוח מתירני לחלוטין שמאפשר שימוש מסחרי, שינוי קוד, הפצה והטמעה בתוך מוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗