GPT
G

GLM-4-32B-0414-GGUF

קוד פתוח

unslothmit2025-04-25

  • transformers
  • gguf
  • glm4
  • text-generation
  • unsloth

גרסת קוונטיזציה של מודל קוד וחשיבה עם 32 מיליארד פרמטרים. מתאימה למי שרוצה יכולות סוכנים וכתיבת קוד הנדסי בהרצה עצמית.

  • 32,768טוקנים בהקשר
  • 495 GBמשקל הקבצים
  • 4,252הורדות בחודש
  • 57לייקים

מה זה

המודל הזה אומן מראש על 15 טריליון טוקנים, שכללו דאטה סינתטי ממוקד חשיבה, ועבר התאמה לשיחה בעזרת משוב אנושי. היצרן שילב שיטות כמו דגימת דחייה ולמידת חיזוק כדי לחדד מענה להוראות, הפעלת פונקציות, יצירת ארטיפקטים וייצור קוד הנדסי. המטרה כאן היא לתת מענה לתשתיות סוכנים שדורשות חיבור לכלים חיצוניים וחיפוש מידע.

בכרטיס נטען כי במבחני ביצוע מסוימים של קוד ושאלות ותשובות, הוא מגיע לתוצאות שדומות למודלים ענקיים בהרבה כמו אלה של OpenAI או DeepSeek. בפועל, החוזק המרכזי שלו הוא מבנה קומפקטי שמכוון ליישומי פיתוח, כתיבת דוחות וממשקים גרפיים כמו קבצי SVG או סימולציות פיזיקליות בקוד, בלי להחזיק תשתית של מאות מיליארדי פרמטרים.

מתאים ל

  • סוכנים מבוססי פונקציות

    אימון ייעודי בחיבור לכלים חיצוניים ושילוב תוצאות חיפוש בדוחות

  • יצירת קוד ממשק וסימולציות

    הדגמות של כתיבת קוד להדמיות פיזיקליות, דפי HTML ואיורי SVG

  • מערכות שאלות ותשובות RAG

    פורמט מובנה לקליטת מידע ממנועי חיפוש וניסוח מענה מבוסס מקורות

איפה זה נופל

המודל מוגדר רשמית רק עבור סינית ואנגלית. עבור משתמש ישראלי, המשמעות היא שאין תמיכה מובטחת בעברית, ולא כדאי להסתמך עליו לפרויקטים בשפה המקומית בלי לבדוק את זה קודם באופן יסודי.

בנוסף, הכרטיס מציג הצלחות מרשימות במשימות ויזואליות כמו קוד לסימולציות או עיצוב ממשקים, אבל הדיווחים מגיעים ישירות מהצוות שאימן את המודל. אין כאן פירוט של שיעורי כשל בהפעלת פונקציות, בעיות בהזיות או חריגות בתחביר, כך שחובה לבחון אותו מול מקרי קצה ספציפיים אצלכם.

שאלות
נפוצות

איך מפעילים את ה־System Prompt בהרצה מקומית?

אם אתם מריצים את קובץ ה־GGUF באמצעות llama.cpp, יש להשתמש בדגל jinja. הדגל הזה מאפשר למערכת לפרש את התבנית של המודל ולהחיל את הפרומפט נכון.

האם המודל עובד בעברית?

השפות היחידות שמוגדרות במפרט המודל הן אנגלית וסינית. לא מומלץ לבנות עליו למשימות בעברית ללא בדיקת היתכנות מקדימה.

איך מריצים

המשקל הכולל של הקבצים בתיקייה מגיע ל־495 גיגה־בייט הפרוסים על פני 33 קבצים, כך שצריך לבחור ולהוריד רק את קובץ ה־GGUF שמתאים למגבלות הזיכרון שלכם ולא את כל המאגר. אם אתם עובדים עם llama.cpp, יש הנחיה מפורשת להוסיף את הדגל jinja כדי שהפרומפט של המערכת יופעל בצורה תקינה.

דרישות החומרה נגזרות מגרסת הקוונטיזציה הספציפית שתורידו מתוך המאגר. אם אין לכם מאיץ גרפי עם מספיק זיכרון להחזיק מודל של 32 מיליארד פרמטרים וחלון של 32,768 טוקנים, תצטרכו להסתמך על שירות חיצוני שמספק גישה דרך API במקום לנסות לטעון אותו מקומית.

ollama run hf.co/unsloth/GLM-4-32B-0414-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון MIT. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקבצים והפצה מחודשת כחלק ממוצר, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗