GPT
D

DeepCoder-14B-Preview

קוד פתוח

agentica-orgmit2025-04-07

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • conversational

מודל קוד של 15 מיליארד פרמטרים שמתחרה ישירות בביצועים של מודלים סגורים וחזקים בהרבה. הוא מיועד למי שרוצה יכולות פתרון אלגוריתמי כבד בלי לשלם על קריאות שרת חיצוניות.

  • 15Bפרמטרים
  • 131,072טוקנים בהקשר
  • 55.0 GBמשקל הקבצים
  • 885הורדות בחודש

מה זה

הצוות אימן את המודל על בסיס DeepSeek-R1-Distill-Qwen-14B בעזרת למידת חיזוק על כעשרים וארבעה אלף צמדי בעיות ובדיקות. המטרה היתה לתת למודל לרוץ על שרשראות חשיבה ארוכות מאוד בלי להישבר, ובמבחן LiveCodeBench v5 הוא מגיע לדיוק של 60.6 אחוזים כשנותנים לו מספיק מרחב יצירה.

בפועל המספרים מציגים תמונה מעניינת. בדירוג Codeforces המודל רושם 1936 נקודות ונמצא באחוזון התשעים וחמש, שזה כמעט צמוד לגרסאות מסוימות של מודלי o1 ו־o3-mini של OpenAI. ההבדל הגדול בינו לבין מודל הבסיס שממנו הוא נוצר ניכר בעיקר ביכולת לחשוב על בעיות תכנות מורכבות שמצריכות אלפי טוקנים של תכנון לפני כתיבת שורת הקוד הראשונה.

מתאים ל

  • פתרון בעיות אלגוריתמיות

    הוא מגיע לאחוזון תשעים וחמש ב־Codeforces ומצטיין בניתוח חידות תכנות שמצריכות חשיבה עמוקה.

  • בדיקת מקרי קצה ובדיקות

    אימנו אותו מול סוויטות בדיקה ולכן הוא חזק בהבנת שגיאות ובחינת קלט מורכב לפני פליטת הקוד.

  • שרת פיתוח פנימי ומאובטח

    הרישיון החופשי מאפשר להרים אותו בארגון שלא מוכן להוציא קוד החוצה למודלים סגורים.

איפה זה נופל

אם תגבילו את מספר הטוקנים של הפלט לשש עשרה אלף, המודל הזה מתרסק בביצועים ומקבל רק 45.6 אחוזים במבחן LiveCodeBench, נמוך אפילו ממודל המקור שלו. הוא נוטה לחפור, להאריך בהסברים ולחשוב בלי סוף, וכשקוטעים אותו באמצע הריצה הפתרון פשוט נשבר ולא עובד.

בנוסף, הכרטיס מציין רק תמיכה באנגלית. הוא לא נבדק על יצירת קוד רגיל של אפליקציות צד לקוח או חיבורי בסיסי נתונים, אלא מתרכז בעיקר בחידות אלגוריתמיות, מתמטיקה ומבחני תכנות תחרותי בסגנון Codeforces.

אותה משפחה

DeepCoder יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להשתמש בו לכתיבת קוד בעברית?

לא. המודל הוגדר ונבדק לשפה האנגלית בלבד, וכל ניסיון לתת לו הנחיות בעברית עלול לגרור הזיות, פגיעה בהיגיון האלגוריתמי שלו או בזבוז מיותר של חלון ההקשר.

למה התוצאות שלו נמוכות כשאני מגביל אותו לתשובות קצרות?

הוא אומן להרחיב את שרשרת החשיבה עד לאלפי טוקנים לפני שהוא מסיק מסקנות. ברגע שמקצצים את אורך הפלט המקסימלי, חותכים לו את תהליך הפתרון לפני שהוא מגיע לקוד עצמו.

איך מריצים

המשקל הגולמי של הקבצים מגיע לחמישים וחמישה גיגה בייט בפורמט המקורי, מה שאומר שבשביל להריץ אותו כמו שהוא צריך כרטיס שרת רציני עם זיכרון וידאו של שישים וארבעה או שמונים גיגה בייט. אם תשתמשו במנועי הסקה כמו vLLM, SGLang או TensorRT-LLM תצטרכו להגדיר להם תמיכה בפלט של לפחות שישים וארבעה אלף טוקנים כדי לנצל את היתרון שלו.

המפתחים ממליצים במפורש לא להשתמש בהנחיית מערכת אלא לדחוף את כל ההוראות לתוך הודעת המשתמש, להגדיר טמפרטורה של 0.6 וערך top-p של 0.95. אם אין לכם חומרה ייעודית כזו בבית או במשרד, הקמה עצמית תהיה עסק יקר ומסורבל מאוד, ובמצב כזה עדיף לצרוך אותו דרך ספקי ענן צד שלישי שתומכים בו כמו Together AI.

from transformers import pipeline

pipe = pipeline("text-generation", model="agentica-org/DeepCoder-14B-Preview")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, אחד הרישיונות הכי חופשיים שיש בעולם הקוד הפתוח. אתם יכולים להוריד אותו, להריץ אותו, לשנות אותו, להטמיע אותו במוצר מסחרי של החברה שלכם ולמכור גישה אליו בלי לשלם תמלוגים. הדרישה היחידה היא לשמור על הצהרת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗