GPT
G

GLM-4.5-Air-Derestricted

קוד פתוח

ArliAImit2025-11-24

  • transformers
  • safetensors
  • glm4_moe
  • text-generation
  • abliterated

גרסה נטולת סירובים של מודל המומחים GLM-4.5-Air. היא מתאימה למי שצריך היגיון חזק וכתיבה חופשית לגמרי בלי לחטוף הודעות סירוב על כל פרומפט גבולי.

  • 110Bפרמטרים
  • 131,072טוקנים בהקשר
  • 206 GBמשקל הקבצים
  • 239הורדות בחודש

מה זה

מדובר בהסבה של GLM-4.5-Air, מודל MoE עם כ־110 מיליארד פרמטרים שבהם 12 מיליארד פעילים בכל טוקן. במקום מחיקה אגרסיבית של וקטור הסירוב שמחרבת את החשיבה הלוגית, ArliAI השתמשו בטכניקה שמשמרת את עוצמת המשקולות המקורית ומנקה רק את כיוון הסירוב עצמו. התוצאה היא מודל שלא עוצר את עצמו וממשיך לתפקד ברמת ההיגיון המקורית.

בבסיסו המודל תוכנן לעבודה כסוכן עצמאי, כולל תמיכה בהפעלת כלים ובשני מצבי עבודה, מצב חשיבה מעמיק ומצב תגובה מהירה. במבחני הביצועים המקוריים גרסת ה־Air השיגה ציון ממוצע של 59.8 ב־12 מבחני תעשייה, שזה קרוב מאוד לגרסה המלאה של 355 מיליארד פרמטרים. השינוי כאן משאיר את היכולות האלה שלמות, בלי לפגוע בהבנת הקשר רחב של עד 131,072 טוקנים.

מתאים ל

  • מחקר אבטחת מידע

    ניתוח חולשות וסימולציות תקיפה בלי שהמודל יסרב לייצר פיילודים או קוד פגיע.

  • סוכנים אוטונומיים

    הרצת תהליכי עבודה מורכבים והפעלת כלים בזכות 12 מיליארד פרמטרים פעילים וזיכרון גדול.

  • כתיבה יצירתית חופשית

    יצירת תוכן עלילתי ודיאלוגים מורכבים בלי לחטוף חסימות על נושאים רגישים.

איפה זה נופל

ההסרה של מנגנוני הסירוב משאירה את המודל חשוף לגמרי. הוא יענה על כל בקשה, כולל תוכן רעיל, פוגעני או מסוכן, בלי שום מעצור פנימי. אם אתם בונים מוצר שפונה לקהל הרחב, תצטרכו לבנות שכבת סינון חיצונית משלכם כדי לא להסתבך.

בנוסף, הטענה לפיה הסרת הסירובים משפרת את ההיגיון נשענת על השערה של המפתחים ולא על בנצ'מרק השוואתי מלא שפורסם עבור הגרסה הזו ספציפית. צריך לבדוק אותו מול המשימות שלכם כדי לוודא שאין הזיות חדשות.

שאלות
נפוצות

למה להשתמש בגרסה הזו במקום במקור של Zhipu AI?

המקור נוטה לסרב לפרומפטים מסוימים מטעמי בטיחות. הגרסה הזו מנקה את התגובות האוטומטיות האלה בשיטה ששומרת על המשקולות, כך שהמודל עונה ישירות על כל הנחיה בלי להתחמק.

האם אפשר להריץ אותו על כרטיס מסך ביתי בודד?

את הגרסה המקורית הזו אי אפשר, כי 206 גיגה-בייט דורשים כמה כרטיסים מקצועיים. לכרטיס ביתי חזק תצטרכו להוריד את גרסת ה־W4A16 המכווצת שצורפה בהפניות.

איך מריצים

המשקל המלא בפורמט bfloat16 שוקל 206 גיגה-בייט ודורש מערך שרתים רציני, לפחות ארבעה כרטיסי A100 או H100 של 80GB כדי להחזיק את המודל ואת הזיכרון להקשר מלא. אתם מריצים אותו דרך transformers, vLLM או SGLang שתומכים בארכיטקטורת Glm4MoeForCausalLM.

אם אין לכם קלאסטר כזה בחצר, עדיף להוריד את גרסאות ה־FP8, ה־INT8 או ה־W4A16 שפורסמו במקביל, או לפנות ישירות ל־API של ספק ענן. להחזיק שרת כזה באופן עצמאי רק בשביל כמה שאילתות ביום זה פשוט בזבוז כסף.

from transformers import pipeline

pipe = pipeline("text-generation", model="ArliAI/GLM-4.5-Air-Derestricted")
print(pipe("שלום"))

הקבצים

55 קבצים במאגר, 206 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל משוחרר ברישיון MIT מלא, שמאפשר שימוש מסחרי, שינוי קוד והפצה מחדש כמעט בלי הגבלות. אתם יכולים להטמיע אותו במוצרים מסחריים סגורים, והדרישה היחידה היא לצרף את הודעת זכויות היוצרים של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗