GPT
D

DeepSeek-V3.1-Base

קוד פתוח

deepseek-aimit2025-08-19

  • transformers
  • safetensors
  • deepseek_v3
  • text-generation
  • conversational

גרסת הבסיס הפתוחה למודל ענק עם הקשר מורחב של 128K טוקנים. אתם מורידים אותה אם אתם מתכננים אימון המשך עצמאי ולא מחפשים מודל שיחה מוכן.

  • 685Bפרמטרים
  • 163,840טוקנים בהקשר
  • 641 GBמשקל הקבצים
  • 32,821הורדות בחודש

מה זה

מדובר במודל גולמי במשקל מלא של כ־685 מיליארד פרמטרים, שמתוכם 37 מיליארד מופעלים בכל מעבר קדימה. הוא נבנה על בסיס צ'קפוינט קודם של V3, אבל עבר הרחבה ייעודית של חלון ההקשר בשני שלבים, כולל אימון על 630 מיליארד טוקנים לטווח של 32K ו־209 מיליארד טוקנים לטווח של 128K. המשקלים והאקטיבציות מאומנים בפורמט UE8M0 FP8 כדי לאפשר תאימות לחישובי מיקרו־סקיילינג.

בניגוד לגרסת הצ'אט המכווננת, גרסת ה־Base לא כוללת מנגנוני חשיבה, תבניות שיחה או הפעלת כלים. כרטיס המודל מציג תוצאות מבחנים מרשימות כמו 93.7 ב־MMLU-Redux ו־66.0 ב־SWE Verified, אך הנתונים האלה שייכים בלעדית לגרסה שעברה כיוונון עדין (V3.1 המכוונן). המשמעות היא שהמשקלים כאן מיועדים לחברות או לצוותי מחקר שרוצים נקודת פתיחה חזקה מאוד לאימון מותאם אישית, ולא למענה ישיר על שאלות.

מתאים ל

  • אימון המשך לארגונים

    בסיס גולמי חזק שתומך בהקשר של 128K, שמתאים להתאמה פנימית על קוד או דוקומנטציה ארגונית בלי הנחות מוקדמות של צ'אט.

  • מחקר על מודלי MoE

    משקלים פתוחים של ארכיטקטורת תערובת מומחים גדולה עם הפעלה של 37 מיליארד פרמטרים מתוך 685 מיליארד לבדיקת שיטות ניתוב.

  • בניית מודלי שפה ייעודיים

    רישיון MIT מאפשר לבצע Post-Training עצמאי ולמכור את המודל המכוונן כמוצר סגור לחלוטין בלי מגבלות שימוש.

איפה זה נופל

זה מודל בסיס, ולכן הוא לא יודע לנהל שיחה, הוא לא מציית להוראות בפורמט צ'אט, והוא פשוט ימשיך את הטקסט שתתנו לו. אם תשאלו אותו שאלה ישירה, הוא עלול לייצר עוד שאלות או להמשיך קטע קוד אקראי. כל היכולות של הפעלת כלים, מצבי חשיבה ופתרון באגים שמופיעות בטבלאות הביצועים אינן זמינות פה בלי שתבצעו כיוונון עדין מקיף בעצמכם.

אותה משפחה

DeepSeek יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להשתמש במודל הזה ישירות לצ'אט או לתכנות?

לא. מדובר בגרסת Base שרק משלימה טקסט ולא אומנה לעקוב אחרי הוראות או לנהל שיחות. בשביל צ'אט, סוכני קוד או הפעלת כלים צריך את גרסת DeepSeek-V3.1 הרגילה שעברה Post-Training, או שתצטרכו לאמן את הגרסה הזו בעצמכם.

האם אפשר להריץ אותו על שרת יחיד עם כרטיס GPU אחד?

ממש לא. הקבצים שוקלים 641 גיגה־בייט ומכילים כ־685 מיליארד פרמטרים בסך הכול. כדי להעלות אותו לזיכרון נדרש מערך של כמה מעבדים גרפיים חזקים מאוד שמחוברים ביניהם, גם כשמשתמשים בכימות של FP8.

מה ההבדל בינו לבין גרסת הבסיס של V3 המקורית?

הגרסה הזו עברה אימון הרחבה ממושך משמעותית לעבודה עם חלונות הקשר ארוכים. המפתחים הגדילו את כמות הטוקנים באימון ל־32K פי עשרה, ואת האימון ל־128K הגדילו ביותר מפי שלושה, לצד התאמה לפורמט FP8 מסוג UE8M0.

איך מריצים

להריץ את זה לבד זה פרויקט תשתית כבד. הקבצים שוקלים 641 גיגה־בייט ב־177 חלקים, ובדיוק bfloat16 מלא תצטרכו קלאסטר של שרתים מרובי כרטיסי H100 או A100 עם זיכרון כולל של מעל טרה־בייט וחצי רק כדי לטעון אותו לזיכרון ולהריץ אינפרנס יציב. ההמלצה הטכנית של המפתחים היא לחשב את פרמטרי התיקון בשכבות הניתוב בדיוק FP32, ולוודא שהסביבה תומכת בספריית DeepGEMM ובפורמט UE8M0 FP8.

אם אתם לא בונים מוצר שדורש אימון פנימי מאפס או התאמה מלאה למערכות מקומיות מטעמי אבטחה, אין שום סיבה להרים חומרה כזו. עדיף לקרוא ל־API חיצוני שמריץ את הגרסה המוכנה ולחסוך אלפי דולרים בחודש על שרתי ענן.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-V3.1-Base")
print(pipe("שלום"))

הקבצים

177 קבצים במאגר, 641 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל משוחרר ברישיון MIT מלא. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לאמן עליו מודלים אחרים, להפיץ אותו ולשלב אותו במוצרים מסחריים סגורים בלי תשלום תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗