GPT
D

DeepSeek-v4-Fable

קוד פתוח

Chunjiang-Intelligenceopenrail2026-06-22

  • transformers
  • safetensors
  • deepseek_v4
  • text-generation
  • cybersecurity

זהו מודל ענק של 149 מיליארד פרמטרים שזוקק מגרסת Fable לטובת משימות סייבר התקפי ואוטונומי, במיוחד פתרון אתגרי CTF ותכנון שרשראות תקיפה בסביבות מבוקרות.

  • 149Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 278 GBמשקל הקבצים
  • 211הורדות בחודש

מה זה

מדובר במודל שמבוסס על DeepSeek-V4-Flash ועבר זיקוק כדי לשמש כסוכן אוטונומי למחקר אבטחה. המטרה שלו היא לא לנהל שיחה נעימה, אלא לתכנן שלבי תקיפה, לחקור פגיעויות ולהריץ כלים ברצף לוגי. הוא אומן בתהליך דו שלבי שכלל כוונון על 80,000 מסלולי פתרון מתוך אתגרי CTF, ולאחר מכן חיזוק באמצעות תגמולים על אבני דרך ממשיות כמו זיהוי שירותים או הדלפות זיכרון.

בבדיקות של היוצרים על 300 אתגרים מבודדים, שילוב שלבי האימון הקפיץ את אחוז ההצלחה הכולל שלו מ־13.5% במודל הבסיס ל־58.7%. השיפור המשמעותי ביותר נרשם באזורים מורכבים כמו ניצול קבצים בינאריים, שם הוא עלה מ־4.1% בלבד ל־44.5%, והנדסה לאחור שבה הוא הגיע ל־51.2%. המשמעות היא שהוא יודע לחקור עצמאית מטרות קשות כשנותנים לו מספיק שלבים לעבוד, בממוצע של כ־13 צעדים עד להשגת היעד.

מתאים ל

  • פתרון אתגרי CTF

    הוא אומן על עשרות אלפי תרחישי פריצה ויודע לתכנן שלבים להשגת דגלים באתגרים.

  • מחקר חולשות בינאריות

    תוצאות המדידה מראות זינוק בביצועי הנדסה לאחור וניצול זיכרון ביחס למודל הבסיס.

  • אימוני צוותים אדומים

    הוא משמש כסוכן עצמאי לבדיקת עמידות של סביבות בדיקה מורשות ומבודדות.

איפה זה נופל

הוא לא מתאים למשימות שפה כלליות או לשימוש כעוזר אישי, והביצועים שלו שם יורדים מיד. הוא אומן בעיקר על אתגרי CTF פומביים, ולכן עלול לייצר הזיות של פקודות לכלי בדיקה או להיכשל מול מערכות אמיתיות שאינן בנויות כמו סביבת תרגול מוגדרת. בנוסף, הוא תומך בארבע שפות בלבד, אנגלית, סינית, יפנית וצרפתית, כך שעברית כלל לא נמצאת ברשימת השפות הנתמכות שלו.

שאלות
נפוצות

האם אפשר להריץ אותו על תחנת עבודה רגילה עם כרטיס בודד?

לא. המודל שוקל 278 גיגה בייט בפורמט המקורי ודורש מערך של כמה מאיצי 80 גיגה כדי להיטען לפעולה.

האם הוא יעבוד טוב כמנוע לעוזר פיתוח כללי בארגון?

ממש לא. המודל כוונן באופן בלעדי לתהליכי סייבר התקפי ואינו מיועד למשימות כתיבה או קוד רגילות.

איך מריצים

כדי להריץ מודל של 149 מיליארד פרמטרים ששוקל 278 גיגה בייט בדיוק של bfloat16, צריך חומרת שרתים כבדה מאוד. תצטרכו לפחות ארבעה עד שמונה כרטיסי מסך מתקדמים עם 80 גיגה זיכרון כדי לטעון אותו, עוד לפני שמנצלים את חלון ההקשר העצום שלו שמגיע למיליון טוקנים.

אם אין לכם קלאסטר ארגוני ייעודי עם חיבורי רשת מהירים בין המעבדים הגרפיים, אין טעם לנסות להרים אותו מקומית. עדיף להמתין לזמינות שלו דרך ספקי ענן או ממשקי API חיצוניים שסופגים את עלויות הברזלים.

from transformers import pipeline

pipe = pipeline("text-generation", model="Chunjiang-Intelligence/DeepSeek-v4-Fable")
print(pipe("שלום"))

הקבצים

57 קבצים במאגר, 278 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון המדווח הוא OpenRAIL. הוא מתיר שימוש מסחרי ומחקרי, אבל מטיל הגבלות שימוש מחמירות מאוד. אסור להפעיל את המודל לסריקה או תקיפה של מערכות ללא אישור מפורש מבעליהן, אסור לייצר איתו נוזקות, כופרות או מנגנוני מעקף, ואין לפגוע במנגנוני הבקרה המובנים בו.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗