GPT
G

GLM-Z1-32B-0414

קוד פתוח

zai-orgmit2025-04-08

  • transformers
  • safetensors
  • glm4
  • text-generation
  • conversational

מודל הסקת מסקנות וחשיבה עמוקה שפותח על בסיס 32 מיליארד פרמטרים. הוא מיועד למי שמחפש ביצועים חזקים במתמטיקה ולוגיקה בלי להחזיק תשתית של מודלי ענק.

  • 33Bפרמטרים
  • 32,768טוקנים בהקשר
  • 60.7 GBמשקל הקבצים
  • 45,712הורדות בחודש

מה זה

המודל נשען על בסיס שאומן על 15 טריליון טוקנים ועבר אימון חיזוק מורחב וממוקד משימות קוד, מתמטיקה ולוגיקה. המטרה כאן היא חשיבה עמוקה בסגנון מודלי תבונה חדשים, שבה המודל מייצר שרשרת מחשבה לפני שהוא עונה. היוצרים שלו מכוונים ישירות לרמה של מודלים מובילים וטוענים לביצועים שמתחרים בכלים גדולים בהרבה בתחומים האלה.

בגודל של כמעט 33 מיליארד פרמטרים, הוא מנסה לתפוס את נקודת האיזון בין יכולת ניתוח מורכבת לבין משקל שעדיין אפשר לנהל מקומית. הוא פועל בארכיטקטורת Glm4 עם 61 שכבות, כשההתמקדות העיקרית היא דיוק בפתרון בעיות טכניות, קוד הנדסי ומעקב קפדני אחרי הוראות.

מתאים ל

  • פתרון בעיות מתמטיקה

    מנגנון החשיבה המובנה מסייע בפירוק הוכחות, פתרון משוואות וחישובים מורכבים הדורשים לוגיקה רב שלבית.

  • ניתוח וכתיבת קוד הנדסי

    אימון החיזוק שם דגש על לוגיקה תכנותית ומעקב מדויק אחרי דרישות טכניות מורכבות.

  • הסקה לוגית מרובת שלבים

    ייצור שרשרת מחשבה פנימית לפני מענה מאפשר לו להתמודד עם שאלות היגיון ללא קיצורי דרך.

איפה זה נופל

המודל אומן רק על אנגלית וסינית, כך שאינו מתאים לעבודה שוטפת בעברית. בנוסף, חלון ההקשר הטבעי עומד על 32,768 טוקנים, אך היוצרים מציינים שבטקסטים מעל 8,192 טוקנים צריך להפעיל ידנית הרחבת YaRN, מה שעלול לפגוע בביצועים על טקסטים קצרים. החשיבה העמוקה שלו דורשת הגדרת תקציב טוקנים גבוה מאוד של עד 30,000 טוקנים ליצירה, מה שמאט את קצב התגובה ומנפח את זמני הריצה.

שאלות
נפוצות

איך דואגים שהמודל באמת יחשוב לפני שהוא עונה?

הכרטיס מדגיש שחובה להוסיף את התגית think בתחילת התשובה כדי להפעיל את מנגנון החשיבה העמוקה. אם משתמשים בתבנית הצ'אט המצורפת לקוד, ההזרקה הזו מתבצעת באופן אוטומטי, יחד עם חיתוך של טקסט המחשבה מההיסטוריה כדי לא להעמיס על השיחה.

האם המודל תומך בטקסטים ארוכים במיוחד?

חלון ההקשר המקורי הוא 32,768 טוקנים, אבל מעל 8,192 טוקנים נדרש להגדיר הרחבת YaRN בקובץ התצורה. שימו לב שהפעלת ההרחבה הזו היא סטטית ועשויה לפגוע מעט באיכות התוצאות כשמזינים קטעים קצרים, לכן כדאי להפעיל אותה רק לפי צורך.

האם יש תמיכה בעבודה בעברית?

המודל מוגדר רשמית עבור אנגלית וסינית בלבד. הוא לא עבר התאמה ייעודית לעברית, ולכן לא מומלץ להסתמך עליו למשימות שדורשות הבנה עמוקה, ניסוח טבעי או חשיבה לוגית בשפה העברית.

איך מריצים

במשקל גולמי של 60.7 גיגה בייט בפורמט bfloat16, לא מריצים אותו על חומרה ביתית פשוטה. כדי לטעון אותו במלואו תצטרכו שרת עם לפחות שני כרטיסי A100 או כרטיסים מקבילים עם מעל 70 גיגה זיכרון וידאו פנוי, או שתבצעו קוונטיזציה שתוריד את דרישות הזיכרון. הרצה בספריית transformers דורשת גרסה 4.51.3 ומעלה.

ההרצה המקומית משתלמת רק אם יש לכם צורך בפרטיות מוחלטת של הקוד והמידע, או סביבת פיתוח פנימית קבועה. אם השימוש שלכם הוא ספורדי או נקודתי לחישובים מורכבים, שירותי ענן ו־API יחסכו לכם תשלום כבד על שרתי עיבוד ייעודיים.

from transformers import pipeline

pipe = pipeline("text-generation", model="zai-org/GLM-Z1-32B-0414")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון MIT. זהו רישיון פתוח ומתירני לחלוטין שמאפשר שימוש מסחרי, שינוי קוד, הפצה מחדש ושילוב במוצרים סגורים, ללא תמלוגים או הגבלות שימוש, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗