GPT
D

deepseek-v4-flash-0731-spark

קוד פתוח

0xSeromit2026-08-01

  • trellis
  • safetensors
  • deepseek_v4
  • deepseek-v4
  • exl3

גרסה מכווצת ומותאמת של מודל ענק שנועדה לרוץ על תחנת DGX Spark בודדת. המטרה היא להריץ מודל 60B מקומי עם ביצועים סבירים בלי להחזיק אשכול שרתים.

  • 60Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 99.5 GBמשקל הקבצים
  • 126,927הורדות בחודש

מה זה

מדובר בהמרה של המודל המקורי מבית DeepSeek שעברה דילול מומחים בשיטת REAP ודחיסה ל־3.0 ביטים למשקל בעזרת EXL3 ו־Trellis. מתוך 256 מומחים בכל שכבה הושארו 216, תוך שמירה מכוונת על מומחים שמטפלים בהפעלת כלים ופלט מובנה. המודל שוקל כ־99.5 גיגה־בייט ונבנה כדי להידחס בדיוק לתוך 128 גיגה־בייט של זיכרון אחוד.

בבדיקות בפועל על חומרה פיזית, המערכת הגיעה לקצב פענוח ממוצע של 39.49 טוקנים לשנייה בקוד, וקצב עיבוד קלט קר של מעל 1,055 טוקנים לשנייה. אלה ביצועים שמישים לחלוטין לעבודה בזמן אמת, אבל המבנה הייעודי הזה דורש מחסנית תוכנה תפורה ואינו מודל כללי שזורקים לכל סביבה.

מתאים ל

  • הפעלת סוכנים וכלים מקומית

    סינון המומחים ב־REAP שמר במכוון על יכולות הפעלת כלים ופלט בפורמט JSON קשיח.

  • שרת ייצור מבוסס DGX Spark

    הקונטיינר מגיע עם גרפי CUDA מוקלטים ומודל ספקולטיבי כדי לסחוט כ־38 טוקנים לשנייה.

  • שליפת עובדות ממסמכים ארוכים

    הבדיקות אישרו שחזור עובדות מדויק מתחילת, אמצע וסוף טקסט בהקשרים של עד 20,000 תווים.

איפה זה נופל

המודל מוגבל לחומרה מסוימת מאוד ולסביבת Docker נעולה, ופקודות טעינה סטנדרטיות פשוט ייכשלו. למרות שחלון ההקשר המקורי תומך ביותר ממיליון טוקנים, ההגדרה כאן נעצרת ב־262,144 טוקנים בגלל מגבלות זיכרון המטמון. בנוסף, מנגנון החשיבה כבוי כברירת מחדל כדי לשמור על מהירות, ויעד הביצועים של 35 טוקנים לשנייה נשבר כלפי מטה באחת מחמש הבדיקות, שם נמדדו 34.30 בלבד. מימוש דחוס של KV ב־NVFP4 גרם לשיבוש טקסט ובוטל לטובת FP8 שתופס יותר מקום.

שאלות
נפוצות

אפשר להריץ את המודל על שרת עם כרטיסי NVIDIA רגילים כמו A100 או H100?

לא. המבנה הנוכחי נשען על SparkInfer וקרנלים מיוחדים לזיכרון ולחומרה של GB10/SM121 בארכיטקטורת ARM64. הרצה על חומרה אחרת דרך vLLM סטנדרטי אינה נתמכת ותיכשל בטעינת המשקלים.

כמה מקום בדיסק צריך בפועל להפעלה הראשונה?

מומלץ לפנות לפחות 300 גיגה־בייט. ההורדה הראשונית שוקלת סביב 107 גיגה־בייט, ובנוסף תהליך העלייה מאחד את המשקלים, בונה מודל טיוטה של 3 גיגה־בייט ומייצר קובצי מטמון כבדים של CUDA.

איך מריצים

המודל הזה לא רץ על כרטיסי מסך ביתיים וגם לא ב־vLLM רגיל. נדרש שרת DGX Spark יחיד עם מעבד ARM64, שבב GB10/SM121 ו־128 גיגה־בייט זיכרון אחוד, לצד 300 גיגה־בייט פנויים בדיסק לקבצים, למטמון ולבניית מודל הטיוטה הספקולטיבי K64.

ההרצה מתבצעת אך ורק דרך תמונת Docker ייעודית של SparkInfer עם Compose מוכן, שמחבר את משקלי ה־TP4 לקובץ שרת יחיד ומגדיר גרפי CUDA. אם אין לכם את החומרה הספציפית הזו, אין טעם להוריד את הקבצים, ועדיף להשתמש ב־API מרוחק של המודל המקורי.

pip install -U huggingface_hub
hf download 0xSero/deepseek-v4-flash-0731-spark

הקבצים

190 קבצים במאגר, 99.5 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון המדווח הוא MIT, שמאפשר שימוש מסחרי, שינוי והפצה כמעט ללא מגבלות למעט מתן קרדיט. עם זאת, היוצר מציין במפורש שהשימוש כפוף גם לתנאי הרישיון המקוריים של מודל הבסיס של DeepSeek, ולכן יש לבדוק אותם לפני שילוב בקוד מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗