GPT
S

SuperDeepseek-V4-Flash-abliterated-MQ-2xDGX

קוד פתוח

Jiunsongmit2026-08-11

  • transformers
  • safetensors
  • deepseek_v4
  • text-generation
  • deepseek-v4

גרסה מהירה ומנוטרלת סירובים של מודל ענק, שמיועדת להרצה מקומית על חומרה כבדה במיוחד. מי שייקח אותה מחפש אוטומציה של כלים בלי מעצורים של מודלי ענן מסחריים.

  • 306Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 158 GBמשקל הקבצים
  • 2,354הורדות בחודש

מה זה

מדובר בעריכה ממוקדת של צ'קפוינט המקור מחברת דיפסיק, שמכיל 306 מיליארד פרמטרים בארכיטקטורת תערובת מומחים. השינוי המרכזי שבוצע כאן הוא ניתוח ישיר של משקולות הקשב כדי לפרק את מנגנון הסירוב של המודל, לצד תיקון לשכבת הפלט. במקום להשתמש במתאמי תוכנה חיצוניים בזמן ריצה, המשקולות המעודכנות צרובות ישירות לתוך קובצי המודל.

במבחני הכרטיס, שיעור הסירוב במצב המחמיר ביותר צנח מ־97.92% ל־4.17%, בלי לשבור את היכולת לעבוד עם כלים חיצוניים שנשארה על 100%. המודל שומר על חלוקת דיוק מעורבת שכוללת מומחים ב־FP4, בלוקים ב־FP8 ושכבות רגישות ב־BF16, כדי לאפשר קריאה של פרומפטים שמגיעים עד למיליון טוקנים בפועל.

מתאים ל

  • סוכני קוד ואוטומציה

    שומר על 100% דיוק בהפעלת כלים ואינו נתקע על סירובים במשימות תשתית רגישות.

  • שליפת נתונים ממסמכי ענק

    תומך בחלון של מיליון טוקנים ומאתר נתונים בודדים בתוך נפח טקסט עצום.

  • צינורות עיבוד ללא צנזורה

    מוריד את שיעור הסירוב ל־4.17% ומאפשר ניתוח טקסטים חופשי מעכבות מובנות.

איפה זה נופל

ההסרה של מנגנוני הסירוב משאירה את המודל חשוף לפליטת מידע מסוכן או שגוי שהמקור חסם, ולכן הסינון עובר כולו לאחריות מי שמריץ אותו. מעבר לזה, קצב הפעולה שנמדד תלוי בהגדרות חומרה ורשת מאוד מסוימות, ולא ישוחזר בסביבה רגילה. הצלחה באיתור מידע בתוך מיליון טוקנים בכרטיס גם אינה מעידה על יכולת ניתוח מושלמת לאורך כל חלון ההקשר.

שאלות
נפוצות

האם המודל ירוץ על כרטיס מסך בודד?

לא. מדובר במודל של 306 מיליארד פרמטרים ששוקל קרוב ל־170 גיגה-בייט גם לאחר דחיסת חלק מהמשקולות ל־FP4 ו־FP8. בשביל להריץ אותו בחלון הקשר מלא צריך שרתי בינה מלאכותית ייעודיים עם זיכרון וידאו מאסיבי וקישוריות מהירה בין המעבדים.

האם המודל יודע לעבוד בעברית?

הכרטיס מצהיר על תמיכה רשמית באנגלית ובקוריאנית בלבד. המודל עשוי לייצר עברית ברמה בסיסית בגלל מידע כללי שנכלל באימון המקור, אך הוא אינו מיועד למשימות מורכבות בשפה זו ולא נבדק עליה.

איך מריצים

כדי להריץ אותו צריך מערך שרתים ייעודי. הבדיקות בכרטיס בוצעו על שני שרתי DGX Spark שמחוברים ברשת RoCEv2 מהירה, תוך שימוש במנוע vLLM עם חלוקה של מקביליות טנזורים לשניים ומטמון במבנה NVFP4. התצורה הזו רשמה קצב של כ־123 טוקנים בשנייה בפלט מובנה של קריאות לכלים בריצה מרובת פניות.

אם אין לכם אשכול שרתים ארגוני מהסוג הזה, אין טעם לנסות להוריד כמעט 170 גיגה-בייט של משקולות למחשב מקומי או לשרת בודד. במצב כזה עדיף לצרוך מודלים בגודל דומה דרך ספקי ענן וספקי ממשק חיצוניים.

from transformers import pipeline

pipe = pipeline("text-generation", model="Jiunsong/SuperDeepseek-V4-Flash-abliterated-MQ-2xDGX")
print(pipe("שלום"))

הקבצים

116 קבצים במאגר, 158 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא MIT מלא, בהתאם לגרסת המקור. אפשר להשתמש במודל לצרכים מסחריים, לשנות אותו, להפיץ אותו מחדש ולהטמיע אותו במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗