GPT
C

CyberNeurova-DeepSeek-V4-Flash-abliterated-GGUF

קוד פתוח

cyberneurovamit2026-05-05

  • gguf
  • abliterated
  • uncensored
  • deepseek
  • llama.cpp

גרסה נטולת מגבלות סירוב של מודל ענק, שמיועדת למחקרי אבטחה והרצה מקומית. השינוי צרוב ישירות במשקולות ולכן אין צורך בקוד מיוחד בזמן הריצה.

  • 374 GBמשקל הקבצים
  • 10,013הורדות בחודש
  • 61לייקים

מה זה

מדובר בהמרה של DeepSeek-V4-Flash למבנה GGUF, שבתוכה צרבו מראש הסרה של מנגנוני הסירוב הרגילים. במקום להסתמך על מעקפים בזיכרון או פרומפטים מורכבים בזמן אמת, המשקולות עצמן שונו כך שהמודל עונה ישירות גם על בקשות שבדרך כלל נחסמות. לפי המדידות של המפרסמים, שיעור הסירוב ירד מ־78.8% לאפס מוחלט במבחני בטיחות סטנדרטיים, וגם במבחן של פרומפטים מורכבים במיוחד הוא צנח ל־3.6%.

היתרון הגדול של גרסה 2 הוא שמירה על היכולות הטכניות בלי לשבור את המבנה. המודל שומר על דיוק מלא בקוד, מציג 99.2% תאימות בהפעלת כלים בפורמט JSON, ואפילו מעלה את אחוזי ההיענות בתחומי בדיקות אבטחה וכתיבת פגיעויות ל־90%. הוא נותן מענה חופשי למחקר, בלי לפגוע בהיגיון הכללי או בקוהרנטיות של התשובות.

מתאים ל

  • מחקר אבטחה הגנתי

    ניתוח חולשות ופגיעויות תוכנה בלי הטיות סירוב מובנות שמפריעות לבדיקות עומק.

  • אימון צוותי תקיפה אדומה

    בדיקת חוסן מערכות מול תרחישי תקיפה מורכבים שהמקור מסרב לעבד.

  • בדיקת גבולות בטיחות

    השוואת ביצועים מול מודל הבסיס כדי לחקור מנגנוני סירוב בתוך ארכיטקטורות תערובת מומחים.

איפה זה נופל

המודל לא נקי לחלוטין מסירובים. בכרטיס מצוין שבערך 3.6% מהפרומפטים החריגים עדיין נתקלים בסירוב רך, כי מחיקה עמוקה יותר הייתה פוגעת ביכולות החשיבה הכלליות שלו. בנוסף, גרסת ה־Q2_K מייצרת רעש ואי דיוקים עקב הדחיסה החריפה של שתי ביט.

החיסרון התפעולי משמעותי עוד יותר. התמיכה בארכיטקטורה הזו נשענת על קוד ניסיוני ולא יציב, וההתנהגות שלו בהקשרים ארוכים מעל 32 אלף טוקנים כלל לא נבדקה. הוא אינו מיועד לייצור יציב.

שאלות
נפוצות

למה אין גרסאות ביניים כמו Q4 או Q5?

הסיבה נעוצה במבנה המקורי של המודל. ארכיטקטורת המומחים שלו מבוססת על FP8, והממיר הקיים תומך כרגע רק ברמות הדחיסה האלו עבור המשקולות הספציפיות.

האם המודל שוכח עובדות או מסוכן יותר מהרגיל?

השינוי רק מסיר את רפלקס הסירוב הטכני אך לא מוסיף ידע חדש. המודל עדיין מזהה הקשרים בעייתיים, הוא פשוט לא מתוכנת לבלום אותם מראש.

אפשר להריץ אותו דרך ספריות פייתון רגילות?

לא ישירות כרגע. התמיכה בפורמט הזה קיימת כרגע רק בענף נפרד של llama.cpp, ולכן צריך להרים אותו כשרת עצמאי ולפנות אליו דרך ה־API המקומי שהוא חושף.

איך מריצים

כדי להריץ אותו אי אפשר להשתמש בגרסה הרשמית של llama.cpp, אלא חייבים לקמפל את הפיצול של antirez שפותח במיוחד לארכיטקטורה הזו. יש שתי גרסאות בלבד, שתיהן כבדות מאוד. גרסת Q2_K שוקלת 98.8 גיגה בייט ודורשת לפחות 128 גיגה בייט של זיכרון עבודה כדי לרוץ בצורה חלקה, למשל על מחשבי מק עם שבבי מקס או אולטרה. גרסת Q8_0 שוקלת 282 גיגה בייט ומחייבת שרת ייעודי עם 320 גיגה בייט זיכרון לפחות או שמונה כרטיסי מסך חזקים.

חובה להגדיר ידנית את רצף העצירה im_end בזמן הריצה, אחרת המודל פשוט ממשיך לפלוט זבל אחרי סיום התשובה. אם אין לכם תחנת עבודה ייעודית עם כמויות זיכרון כאלה, אין מה לנסות להריץ אותו על מחשב רגיל.

ollama run hf.co/cyberneurova/CyberNeurova-DeepSeek-V4-Flash-abliterated-GGUF:Q8_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא MIT מלא, שממשיך את הרישיון של מודל המקור. אפשר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים בלי תמלוגים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים ונוסח הרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗