GPT
D

DeepSeek-V4-Flash-0731-abliterated

קוד פתוח

cebeuqmit2026-08-01

  • transformers
  • safetensors
  • deepseek_v4
  • text-generation
  • abliterated

גרסה נטולת מגבלות סירוב של DeepSeek-V4-Flash, שמיועדת להרצה עצמית של סוכני קוד ומחקר על חומרה כבדה ללא חסימות בטיחות מובנות.

  • 306Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 157 GBמשקל הקבצים
  • 14,674הורדות בחודש

מה זה

מדובר בעריכה ממוקדת של 92 טנסורים בלבד מתוך מעל 72 אלף במודל המקורי, שנועדה למחוק את מנגנוני הסירוב מבלי לפגוע ביכולות הקידוד או קריאות הכלים שלו. השינוי נעשה ישירות על משקלי FP8 ו־FP4 בלי תהליך קוונטיזציה מחדש, מה שמשאיר את רוב המשקולות זהים לחלוטין לקבצי המקור.

בדיקות הסירוב הציגו אפס סירובים במדגם שנבדק, גם במצבי החשיבה המעמיקים וגם בשיחה רגילה, לצד שמירה מלאה על תאימות לקריאות כלים בפורמט DSML. קצב הייצור מגיע ל־75.5 טוקנים לשנייה עבור פלט JSON מובנה, ו־71.7 טוקנים לשנייה בקוד תחת הרצה של שני שרתי Spark במקביל.

מתאים ל

  • סוכני פיתוח אוטונומיים

    ביצוע קריאות כלים וכתיבת קוד ברצף ללא עצירות על תוכן רגיש לכאורה.

  • מחקרי אבטחת מידע וסייבר

    ניתוח חולשות וסימולציות התקפה שהיו נחסמות מיד במודלים מסחריים רגילים.

  • עיבוד פלטים מובנים ב־JSON

    השגת מהירות פענוח של מעל 75 טוקנים לשנייה בזכות תמיכה בספקולטיביות מובנית.

איפה זה נופל

בדיקות היכולת בכרטיס התמקדו בקריאות כלים בלבד, ללא מדידות של ביצועים כלליים במבחנים כמו HumanEval או MMLU-Pro. בנוסף, חלון ההקשר העצום לא נבדק לעומק, וההסרה של מנגנוני הסירוב עשויה שלא להחזיק מעמד בטקסטים ארוכים במיוחד של עשרות ומאות אלפי טוקנים. פניות שעוסקות בחשיפת מידע אישי או פגיעה עצמית נוטות להמשיך להפעיל סירובים במבנה הזה.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס RTX ביתי בודד?

לא. המודל דורש לפחות שני שרתי Spark עם 128 גיגה-בייט זיכרון בכל אחד וחיבור רשת מהיר במיוחד ביניהם. אפילו עם קוונטיזציה קיימת, 157 גיגה-בייט של משקלים לא ייכנסו בשום חומרה שאינה שרת ייעודי.

האם הסרת הסירוב פגעה ביכולת של המודל לכתוב קוד?

לפי נתוני הכרטיס, מנגנון קריאות הכלים שמר על מאה אחוז תאימות, והמשקלים של מומחי החישוב לא שונו כלל. יחד עם זאת, היוצרים מודים שמבחני יכולת כלליים לא נבדקו ישירות על הגרסה הזו.

איך מריצים

המודל שוקל 157 גיגה-בייט ודורש שרתי ענן ייעודיים. הכרטיס מציג הרצה על גבי שני מחשבי NVIDIA DGX Spark עם 128 גיגה-בייט זיכרון בכל אחד, באמצעות vLLM וחלוקת משקלים של Tensor Parallel שווה ל־2, יחד עם שימוש בהרחבות FlashInfer ייעודיות לחישוב MoE. אם אין לכם גישה למערך חומרה כזה או תקציב שרתי ענן ברמה הזו, עדיף להשתמש ב־API של המודל המקורי במקום לנסות להרים אותו לבד.

from transformers import pipeline

pipe = pipeline("text-generation", model="cebeuq/DeepSeek-V4-Flash-0731-abliterated")
print(pipe("שלום"))

הקבצים

89 קבצים במאגר, 157 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא MIT, מה שאומר שמותר להשתמש בו לכל מטרה, כולל מוצרים מסחריים ושינויים בקוד או במשקלים, בלי תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית והסרת אחריות מהיוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗