GPT
D

DeepSeek-V3-0324

קוד פתוח

deepseek-aimit2025-03-24

  • transformers
  • safetensors
  • deepseek_v3
  • text-generation
  • conversational

גרסה מעודכנת של מודל ענק עם 685 מיליארד פרמטרים וחלון של 163,840 טוקנים. היא מציגה קפיצה משמעותית בביצועי קוד, מתמטיקה וקריאות לפונקציות תחת רישיון פתוח לחלוטין.

  • 685Bפרמטרים
  • 163,840טוקנים בהקשר
  • 641 GBמשקל הקבצים
  • 986,034הורדות בחודש

מה זה

העדכון הזה משמר את אותה ארכיטקטורה בסיסית של קודמו ברשת של 61 שכבות, אבל דוחף קדימה את יכולות ההסקה והפיתוח. במבחנים טכניים נרשם שיפור ניכר, למשל זינוק מ־39.6 ל־59.4 במבחן AIME במתמטיקה, ועלייה מ־39.2 ל־49.2 במבחן התכנות LiveCodeBench. בפועל, המשמעות היא שהמודל מייצר קוד פרונטאנד ישים יותר עם פחות תקלות ריצה, ופותר בעיות לוגיות מורכבות בדיוק גבוה מבעבר.

בנוסף לשיפורים הללו, היצרן חיזק את היציבות של קריאות לפונקציות ותיקן בעיות שהופיעו בגרסאות קודמות, לצד שיפור ביכולות כתיבה ותרגום בסינית שיושרו לפי הסגנון של סדרת R1. עם חלון הקשר עצום של מעל 160 אלף טוקנים, הוא מסוגל לעבד מסמכים ארוכים ומחקרים נרחבים בלי לאבד פרטים.

מתאים ל

  • פיתוח פרונטאנד ואתרים

    מייצר קוד דפי אינטרנט ומשחקים בדפדפן בדיוק גבוה יותר ובאיכות ויזואלית טובה מהגרסאות הקודמות.

  • סוכני אוטומציה וכלים

    הדיוק המשופר במנגנון ה־Function Calling מאפשר לחבר אותו למערכות חיצוניות בצורה יציבה ואמינה.

  • פתרון בעיות מתמטיקה

    הקפיצה בתוצאות במבחן AIME הופכת אותו למתאים במיוחד להסקה לוגית וחישובים מורכבים.

איפה זה נופל

הבעיה המרכזית כרגע היא תמיכה טכנית ישירה: ספריית transformers הרשמית עדיין לא תומכת במודל הזה באופן ישיר, מה שמחייב שימוש במימושים מותאמים מתוך המאגר המקורי. בנוסף, חלק ניכר ממאמצי האופטימיזציה בכרטיס הושקע ספציפית בניסוחים ובחיפוש בשפה הסינית, כך ששיפורים מסוימים עשויים להיות פחות מורגשים בשפות אחרות. חובה לבדוק את התנהגות קריאות הפונקציות מול הסכמות שלכם לפני שמסתמכים עליהן בייצור.

שאלות
נפוצות

האם אפשר לטעון את המודל ישירות דרך transformers?

נכון לעכשיו לא. כרטיס המודל מציין במפורש שאין עדיין תמיכה ישירה בספריית transformers של Hugging Face, ויש להשתמש בהנחיות ההרצה מתוך מאגר הגיטהאב של DeepSeek-V3.

איך מומלץ להגדיר את הטמפרטורה בשימוש במודל?

היצרן ממליץ על טמפרטורה פנימית של 0.3 לקבלת ביצועים מיטביים. אם פונים דרך ממשק שמניח ברירת מחדל של 1.0, צריך לוודא שהערך מותאם או ממופה כדי למנוע ירידה באיכות הפלט.

איך מריצים

כדי לארח מפלצת של 641 גיגה-בייט במשקלי bfloat16 גולמיים, צריך אשכול שרתים רציני עם כמה מאיצי GPU יקרים מאוד שמחוברים ביניהם ברוחב פס גבוה. הרצה מקומית על מחשב בודד או שרת פשוט אינה אפשרית בגודל הזה.

אם אין לכם תשתית ענן ייעודית ותקציב חומרה כבד, עדיף להשתמש ב־API מנוהל שמספק גישה למודל. מי שמריץ בעצמו צריך לשים לב להמלצת היצרן לכוון את הטמפרטורה ל־0.3, או להשתמש במיפוי המתאים כדי לקבל תוצאות מדויקות ולא מפוזרות.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-V3-0324")
print(pipe("שלום"))

הקבצים

173 קבצים במאגר, 641 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל והמשקלים משוחררים תחת רישיון MIT. זהו רישיון מתירני שמאפשר שימוש מסחרי חופשי, שינוי, הפצה ושילוב במוצרים סגורים בלי תשלום תמלוגים, כשהדרישה היחידה היא שמירת הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗