GPT
D

DeepSeek-V2-Chat-0628

קוד פתוח

deepseek-aiother2024-07-18

  • transformers
  • safetensors
  • deepseek_v2
  • text-generation
  • conversational

גרסה משופרת למודל ענק עם 236 מיליארד פרמטרים שמתמקדת בקוד ומתמטיקה. הוא הגיע למקום שלישי ב־Arena לקוד, אבל דורש חומרת קצה יקרה מאוד להרצה עצמאית.

  • 236Bפרמטרים
  • 163,840טוקנים בהקשר
  • 439 GBמשקל הקבצים
  • 5,095הורדות בחודש

מה זה

מדובר בעדכון מקיף לגרסת השיחה של DeepSeek-V2, שמיועד בעיקר למשימות מורכבות של פיתוח תוכנה, מתמטיקה ופתרון פרומפטים קשים. לפי הנתונים שפרסמו המפתחים, המודל רשם קפיצה משמעותית במיוחד בפתרון בעיות מתמטיקה ממבחן MATH עם ציון של 71.0 לעומת 53.9 בגרסה הקודמת, ובמבחן Arena-Hard הוא זינק מ־41.6 ל־68.3. במבחן HumanEval לכתיבת קוד הוא הגיע ל־84.8 נקודות.

השיפור מורגש גם במעקב אחרי הוראות מורכבות עם עלייה ל־77.6 במדד IFEval ושיפור ביצירת מבני JSON פנימיים ל־85 נקודות. צוות הפיתוח כיוון את השינויים כך שיתאימו לתרחישי RAG ותרגום שדורשים היצמדות מדויקת להנחיות מערכת, לצד חלון הקשר עצום של 163,840 טוקנים שמתאים לעיבוד קבצי קוד ומסמכים ארוכים.

מתאים ל

  • ניתוח וכתיבת קוד מורכב

    מדורג במקום השלישי ב־Coding Arena ומשיג 84.8 ב־HumanEval, מה שמספק דיוק גבוה במשימות תכנות.

  • פתרון בעיות חישוביות

    קפיצה ל־71 נקודות במבחן MATH מאפשרת לטפל בחישובים והוכחות שדגמים אחרים נכשלים בהם.

  • שליפת מידע ממסמכים ארוכים

    חלון של 163,840 טוקנים ושיפור במעקב אחר הוראות מערכת מתאימים למערכות RAG שסורקות טקסט רב.

איפה זה נופל

הקושי העיקרי הוא סף החומרה המפלצתי שדורש 8 כרטיסי 80GB רק בשביל להרים מופע בודד. בנוסף, המודל דורש תבנית שיחה חדשה ושונה מהגרסה הקודמת, מה שמחייב עדכון קוד קיים. שימו לב שהכרטיס אינו מפרט נתונים לגבי ביצועים בעברית, ולכן חובה לבדוק את איכות הפלט וההיצמדות להוראות בשפה המקומית לפני שמסתמכים עליו.

שאלות
נפוצות

האם אפשר להריץ את המודל על שרת עם שני כרטיסי מסך?

לא בגרסה המקורית שלו. המודל דורש 8 כרטיסי מסך של 80GB כל אחד כדי לעלות בפורמט bfloat16, כך ששני כרטיסים לא יספיקו אפילו לקריאת הקבצים לזיכרון.

האם צריך לשנות את הקוד של מערכת קיימת אם כבר עבדנו עם הגרסה הקודמת?

כן, כרטיס המודל מציין במפורש שתבנית השיחה עודכנה לעומת הגרסה הראשונה. תצטרכו להטמיע את התבנית החדשה מתוך הגדרות הטוקנייזר כדי שהמודל יבין את חלוקת התפקידים נכון.

איך מריצים

כדי להריץ את המודל עצמאית בדיוק המקורי של bfloat16 תצטרכו שרת עם 8 כרטיסי מסך של 80GB כל אחד, כלומר 640GB של זיכרון וידאו ייעודי. סך המשקל של קבצי המודל מגיע ל־439 גיגה בייט, כך שצוואר הבקבוק בחומרה משמעותי מאוד ולא נגיש לתחנות עבודה רגילות.

אפשר להריץ אותו דרך ספריית transformers או דרך vLLM, שדורשת מיזוג של pull request ספציפי לקוד שלהם כדי לעבוד. אם אין לכם אשכול שרתים ארגוני פנוי, עדיף להשתמש ב־API הרשמי שלהם במקום לשלם אלפי דולרים בחודש על השכרת מכונות.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-V2-Chat-0628")
print(pipe("שלום"))

הקבצים

69 קבצים במאגר, 439 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

קוד הפרויקט מופץ תחת רישיון MIT, אך משקלי המודל עצמם כפופים להסכם שימוש ייעודי בשם Model License של החברה. הכרטיס מציין במפורש שהסדרה תומכת בשימוש מסחרי, כך שניתן לשלב את התוצרים במוצר מסחרי כל עוד עומדים בתנאי ההסכם המצורף.

הרישיון המלא בעמוד המודל ↗