GPT
C

cerebras_GLM-4.5-Air-REAP-82B-A12B-GGUF

קוד פתוח

bartowskiרישיון לא דווח2025-10-20

  • gguf
  • text-generation
  • endpoints_compatible
  • imatrix
  • conversational

גרסה מכווצת של GLM-4.5-Air בעיבוד cerebras, שנועדה לתת יכולות של מודל ענק במבנה תערובת מומחים. מתאים למי שרוצה להריץ מודל 82B מקומית בלי לקרוס תחת משקל של קבצים מלאים.

  • 1.1 TBמשקל הקבצים
  • 1,936הורדות בחודש
  • 45לייקים

מה זה

מדובר במודל שפה שמבוסס על cerebras GLM-4.5-Air-REAP-82B-A12B, שהומר לפורמט GGUF בעזרת llama.cpp גרסה b6818. הוא משתמש בשיטת כיול imatrix עם נתונים ייעודיים כדי לשמור על דיוק מקסימלי בזמן הדחיסה. המבנה הוא תערובת מומחים עם 82 מיליארד פרמטרים בסך הכל, כשבפועל רק 12 מיליארד פעילים בכל מעבר, מה שאמור להאיץ את מהירות החישוב ביחס למודלים צפופים באותו סדר גודל.

ההבדל העיקרי כאן הוא הדחיסות והמגוון. היוצר יצר מעל עשרים רמות כיבוץ שונות, החל מגרסאות קיצוניות של 1 ביט ועד לקבצי 8 ביט כבדים. בחלק מגרסאות הביניים כמו Q4_K_L נעשה שימוש בטכניקה שמשאירה את שכבות הקלט והפלט באיכות גבוהה של 8 ביט כדי למנוע ירידה חדה באיכות הפלט.

מתאים ל

  • הסקה מקומית על שרת פרטי

    מאפשר הרצה של מודל ענק עם מומחים פעילים בארגונים שלא מוציאים נתונים החוצה.

  • בדיקת איכות כיבוץ ב־GGUF

    היצע של מעל עשרים רמות דחיסה מאפשר להשוות ירידת דיוק מדויקת עבור ארכיטקטורת MoE.

  • פיתוח יישומי llama.cpp

    מתאים לטעינה נוחה בסביבות כמו LM Studio בזכות תמיכה ב־imatrix ובסידור מחדש של משקולות.

איפה זה נופל

הבעיה הבולטת ביותר בדף המודל היא תבנית השיחה. היוצר מציין במפורש שלא הוגדר chat template עבור הקבצים ולכן נעשה שימוש בברירת מחדל, מה שעלול לשבש את הפלטים ולדרוש מכם להגדיר ידנית את מבנה הפרומפט לפי המודל המקורי. בנוסף, גרסאות הדחיסה הנמוכות מאוד, כמו IQ1_M או סדרת 2 ביט, מוגדרות בעמוד כבעלות איכות ירודה במיוחד ולא מומלצות לשימוש מעשי.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד מתוך הרשימה?

עבור רוב השימושים מומלץ לקחת את Q4_K_M ששוקל 56.57 ג'יגה בייט, או את IQ4_XS ששוקל 46.99 ג'יגה בייט אם חסר לכם קצת מקום. גרסאות אלו מציעות פשרה סבירה בין גודל הקובץ לבין שימור יכולות ההסקה של המודל המקורי.

מדוע חלק מהקבצים מחולקים למספר חלקים?

קבצים ששוקלים מעל 50 ג'יגה בייט פוצלו כדי לאפשר הורדה יציבה דרך Hugging Face. כדי להוריד אותם צריך להשתמש בתוכנת שורת הפקודה huggingface-cli עם הפניה לתיקייה המלאה של אותה גרסה.

איך מריצים

כדי להריץ אותו צריך חומרה רצינית. משקל הקבצים מתחיל ב־29.40 ג'יגה בייט בגרסת IQ1_M ומגיע עד 90.37 ג'יגה בייט ב־Q8_0. גרסאות ברירת המחדל המאוזנות, כמו Q4_K_M ששוקלת 56.57 ג'יגה בייט, מפוצלות למספר קבצים ודורשות שילוב של לפחות 64 ג'יגה זיכרון וידאו או זיכרון מערכת מאוחד רחב כדי לעבוד בצורה סבירה. אפשר לטעון את הקבצים ישירות בתוך LM Studio או דרך llama.cpp, כשהמערכת תומכת בסידור מחדש של משקולות בזמן אמת למעבדי ARM ו־AVX.

אם אין לכם תחנת עבודה ייעודית מרובת כרטיסים או מחשב Mac חזק עם זיכרון מאוחד גדול, חבל על הזמן. במקרים כאלה עדיף בהחלט לשלם על קריאות API לשירות ענן שמחזיק את המודל המקורי.

ollama run hf.co/bartowski/cerebras_GLM-4.5-Air-REAP-82B-A12B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

37 קבצים במאגר, 1.1 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון של המודל לא דווח בדף שלו. המשמעות היא שאין אישור מפורש לשימוש מסחרי, ואי אפשר לדעת מה המגבלות החוקיות על הפצה או שילוב שלו במוצר מסחרי. לפני שמשלבים אותו בקוד פעיל, חובה לבדוק את תנאי הרישיון המקוריים במאגר של cerebras.

הרישיון המלא בעמוד המודל ↗