GPT
G

GLM-5.3-UNCENSORED-NVFP4

קוד פתוח

dealignaiרישיון לא דווח2026-08-29

  • safetensors
  • glm_moe_dsa
  • abliterated
  • uncensored
  • crack

גרסה נטולת הגנות של מודל ענק עם 753 מיליארד פרמטרים, שנבנתה ישירות ברמת המשקולות כדי לספק קוד התקפי מלא לבדיקות חדירה ומחקר אבטחה.

  • 1,048,576טוקנים בהקשר
  • 433 GBמשקל הקבצים
  • 2,867הורדות בחודש
  • 41לייקים

מה זה

מדובר במודל MoE עצום שמפעיל כ־18 מיליארד פרמטרים בכל טוקן, ועבר עריכת משקולות ישירה להסרת סירובים במקום כוונון עדין או מעקפי פרומפטים. המטרה כאן היא עבודה ישירה מול בקשות סייבר התקפי, כמו יצירת כלי כופר, נוזקות, סקריפטים להסלמת הרשאות ופיילודים, תחומים שמודלים רגילים עוצרים מיד. בבדיקות של HarmBench המודל הציג 0 אחוזי סירוב במצבי חשיבה גבוהים, ואישר יצירת קוד תקין לכלי פריצה מוכרים.

מבחינת יכולות כלליות, עריכת המשקולות כמעט לא שברה את היכולות הלוגיות. ציון ה־MMLU שלו עומד על 84.11 אחוזים, ירידה קלה של פחות מנקודת אחוז וחצי מול מודל הבסיס. זה אומר שמקבלים מודל עם ידע רחב ויכולת ניתוח טכנית גבוהה, שמסוגל לעבד קונטקסט ולכתוב סקריפטים מורכבים בלי להיכנס ללולאות תקועות או לפלוט מלל שבור.

מתאים ל

  • בדיקות חדירה וסימולציות

    יצירה אוטומטית של פקודות וסקריפטים להתקפה בזמן אמת, בלי שהמודל יחסום את הבקשות בגלל פקודות חשודות.

  • פיתוח פיילודים לתרגילים

    כתיבת כלי הדגמה כמו shell חוזר או הסלמת הרשאות בלי סינונים, עבור תרחישי אימון והדמיית יריב.

  • ניתוח מעמיק של נוזקות

    הבנת לוגיקה זדונית מורכבת בזכות חלון הקשר גדול ויכולות חשיבה שמפרקות קוד סגור.

איפה זה נופל

הקונטקסט המלא של מיליון טוקנים לא שמיש בפועל ב־vLLM בגלל באג פנימי בזיכרון ה־DSA שקורס בחלוקת הדפים, כך שהגבול המעשי בשרת של שמונה כרטיסים עומד על כ־512 אלף טוקנים. בנוסף, מנגנון החשיבה סובל מבאג הגדרות: אי אפשר לכבות אותו לגמרי, וכל ערך שאינו low מעביר את המודל ל־max, מה שעלול לשרוף את כל תקציב הטוקנים על בלוק החשיבה ולהשאיר את התשובה הסופית קטועה. שדות הפלט של החשיבה מוחזרים במפתח נפרד מהמקובל, ונושאי זכויות יוצרים עדיין נתקלים בסירובים.

שאלות
נפוצות

האם אפשר לכבות לגמרי את מנגנון החשיבה כדי לקבל תשובות מהירות?

לא. המודל מזהה רק ערכי low ו־high עבור מאמץ החשיבה. כל הגדרה אחרת, כולל ניסיון לכבות אותו, זורקת את המערכת למצב מקסימלי שמאריך את הריצה.

האם כדאי להוריד את גרסת ה־NVFP4 כדי להאיץ את מהירות התגובה?

לא בשביל מהירות. הכיווץ הזה נועד לצמצם תפיסת זיכרון ולאפשר קונטקסט ארוך יותר, אך המשקולות עוברות המרה בזמן אמת והביצועים דומים לגרסאות אחרות.

איך מריצים

כדי להרים 433 גיגה-בייט של קבצים צריך חומרת שרתים כבדה מאוד. הוא נבדק על שרת של שמונה מאיצי DGX Spark GB10 עם vLLM ומקביליות טנזורים של 8, תוך שימוש ב־FlashInfer בגרסה 0.6.18 ומעלה עבור מנגנון ה־DSA. בקוונטיזציית NVFP4 המומחים המנותבים מכווצים בעוד שכבות תשומת הלב נשארות ב־bf16, מה שנועד לחסוך זיכרון ל־KV pool ולאו דווקא להאיץ את קצב הייצור.

אם אין לכם אשכול ייעודי של כרטיסי H100 או GB10, אין טעם לנסות להריץ אותו מקומית. עבור רוב המפתחים והחוקרים, הקמה עצמית כזו תדרוש שרת שעולה עשרות אלפי שקלים בחודש, כך שאם קיים ספק שמציע גישה למשקולות האלו דרך API, זה המסלול היחיד שנשמע הגיוני כלכלית.

pip install -U huggingface_hub
hf download dealignai/GLM-5.3-UNCENSORED-NVFP4

הקבצים

292 קבצים במאגר, 433 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון לא דווח בעמוד המודל. במצב כזה אין אישור שימוש מסחרי מוגדר, ואי אפשר לדעת אילו הגבלות משפטיות חלות עליו או על מודל הבסיס. כל שילוב שלו במוצר מסחרי או במערכת ארגונית מהווה סיכון משפטי ישיר, לצד האחריות הבלעדית שהמפרסמים מטילים על המשתמש בעקבות הסרת מנגנוני הבטיחות.

הרישיון המלא בעמוד המודל ↗