GPT
D

DeepSeek-V4-Pro

קוד פתוח

deepseek-aimit2026-04-22

  • transformers
  • safetensors
  • deepseek_v4
  • text-generation
  • conversational

מודל ענק בקוד פתוח עם חלון של מיליון טוקנים וביצועי קוד חריגים. הוא מיועד למי שצריך ניתוח מעמיק של מסדי קוד שלמים בלי לשלוח נתונים לענן חיצוני.

  • 1599Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 805 GBמשקל הקבצים
  • 623,492הורדות בחודש

מה זה

מדובר במודל MoE עם כמעט 1.6 טריליון פרמטרים בסך הכול, אבל בפועל מופעלים רק 49 מיליארד בכל טוקן. הוא נבנה כדי לפתור את צוואר הבקבוק של חלונות הקשר ארוכים, ומשתמש בשילוב של דחיסת קשב שמורידה את צריכת הזיכרון של ה־KV cache לתשיעית לעומת הדור הקודם. האימון התבסס על יותר מ־32 טריליון טוקנים, כולל שלב זיקוק ממומחים שונים כדי לחבר יכולות מתמטיקה, קוד והסקה.

במדדי ביצועים המודל מציג רמה תחרותית מאוד מול השמות הגדולים. במצב החשיבה המרבי שלו הוא מגיע לדירוג של 3206 ב־Codeforces ו־93.5% ב־LiveCodeBench, שזה גבוה מרוב המתחרים המסחריים הסגורים. מנגד, במשימות ידע כללי כמו SimpleQA הוא נעצר ב־57.9%, כך שאי אפשר לסמוך עליו כעל אנציקלופדיה עובדתית מוחלטת.

מתאים ל

  • ניתוח ריפוזיטורי שלם

    הוא מחזיק חלון של מיליון טוקנים ומגיע ל־93.5% ב־LiveCodeBench, מה שמתאים לחיפוש באגים בקוד מורכב.

  • פתרון בעיות מתמטיקה

    במצב חשיבה מרבי הוא מגיע ל־95.2% במבחן HMMT ומסוגל לפרק הוכחות ארוכות ומסובכות שלב אחר שלב.

  • תחקור מסמכים ארוכים

    שילוב של דחיסת הקשב החדשה עם ציון של 83.5% במבחן MRCR מאפשר לשלוף עובדות מתוך הררי טקסט טכני.

איפה זה נופל

במצב הרגיל ללא חשיבה מעמיקה המודל מאבד גובה בצורה קיצונית. למשל, ב־Apex הוא צונח מ־38.3% ל־0.4% בלבד, וב־LiveCodeBench מ־93.5% ל־56.8%. המשמעות היא שחייבים להקצות לו תקציב טוקנים נכבד לחשיבה כדי לקבל תוצאות טובות, והמפתחים ממליצים על חלון של לפחות 384,000 טוקנים במצב המרבי. בנוסף, במבחני סוכנים כמו HLE עם כלים הוא השיג 48.2%, תוצאה נמוכה יותר מחלק מהדגמים המתחרים.

אותה משפחה

DeepSeek-V4-Pro יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להריץ את המודל הזה על תחנת עבודה יחידה במשרד?

לא. מדובר ב־805 גיגה-בייט של משקלים שמחייבים קלאסטר מרובה כרטיסים ייעודיים. תחנת עבודה סטנדרטית עם כרטיס או שניים אפילו לא תוכל לטעון אותו לזיכרון.

למה המפתחים לא שילבו תבנית שיחה רגילה בטוקנייזר?

הם בחרו במימוש נפרד שמקודד ומפענח את תגיות החשיבה דרך קבצי פייתון ייעודיים בתיקיית encoding. צריך להשתמש בפונקציות שלהם כדי לנהל את המעבר בין מצבי החשיבה השונים.

האם המודל מתאים למענה מהיר בזמן אמת?

רק במשימות טריוויאליות מאוד. היכולות המרשימות שלו מופיעות רק במצבי החשיבה שדורשים פליטת אלפי טוקנים מקדימים, ולכן יש כאן השהיה מובנית שמחייבת סבלנות.

איך מריצים

המשקל הכולל של הקבצים עומד על 805 גיגה-בייט ומחולק לעשרות קבצים, כאשר משקלי המומחים מגיעים בדיוק מעורב של FP4 ו־FP8. כדי להרים אותו מקומית בתצורת ה־Pro צריך אשכול שרתים רציני עם כמה עשרות כרטיסי מסך מודרניים רק בשביל לטעון את המשקלים לזיכרון, עוד לפני שמחשבים את ה־KV cache לחלון המלא.

למי שאין חוות שרתים ייעודית, עדיף בהרבה לפנות ל־API חיצוני או לבחור בגרסת ה־Flash הקטנה יותר שמפעילה 13 מיליארד פרמטרים. בנוסף, המודל לא מגיע עם תבנית שיחה סטנדרטית מסוג Jinja, אלא דורש שימוש בסקריפטי פייתון ייעודיים שהמפתחים צירפו כדי להמיר את ההודעות למחרוזת קלט.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-V4-Pro")
print(pipe("שלום"))

הקבצים

91 קבצים במאגר, 805 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא MIT, וזה הרישיון הכי פתוח ומאפשר שיש. אפשר לקחת את המשקלים, לשנות אותם, לשלב אותם במוצר מסחרי סגור, לארח אותם כשירות בתשלום או למכור פתרונות מבוססים עליהם. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד או בהפצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗