GPT
D

DeepSeek-V2-Lite

קוד פתוח

deepseek-aiother2024-05-15

  • transformers
  • safetensors
  • deepseek_v2
  • text-generation
  • conversational

זה מודל שפה חסכוני מסוג תערובת מומחים שדורש רק 2.4 מיליארד פרמטרים פעילים בכל רגע. הוא נותן פתרון למי שרוצה ביצועים טובים בלי לשלם עלויות חישוב של מודלים ענקיים.

  • 16Bפרמטרים
  • 163,840טוקנים בהקשר
  • 29.3 GBמשקל הקבצים
  • 331,656הורדות בחודש

מה זה

מדובר בגרסה מוקטנת של DeepSeek-V2, הבנויה כארכיטקטורת MoE עם 16 מיליארד פרמטרים בסך הכל. ההבדל הגדול בינו לבין מודלים דחוסים בגודל שבעה מיליארד פרמטרים הוא שרק 2.4 מיליארד פרמטרים מופעלים בכל טוקן, מה שמוריד את עלות הריצה בזמן אמת. הוא משתמש במנגנון תשומת לב דחוס בשם MLA כדי לצמצם את תפיסת הזיכרון של ה־KV cache, מה שמקל מאוד על שמירת הקשר ארוך.

במבחנים שהיוצרים מציגים, המודל עוקף מודלים ותיקים בגדלים דומים באנגלית ובסינית, במיוחד במתמטיקה ובקוד. למשל, ב־GSM8K הוא מגיע לציון 41.1 לעומת 17.4 של מודל דחוס מקביל, וב־HumanEval הוא מציג 29.9 נקודות. המשמעות היא שבתור מודל בסיס הוא מבין לוגיקה ומבנה בצורה חדה בהרבה ממה שהיה מקובל בגדלים כאלה בעבר.

מתאים ל

  • בסיס לאימון מודל קוד פנימי

    הוא מציג תוצאות גבוהות ב־HumanEval ביחס לגודלו ויכול לשמש בסיס זול להתאמה ייעודית למאגרי קוד.

  • פתרון בעיות חישוב ומתמטיקה

    ציוני ה־GSM8K שלו גבוהים בהרבה ממודלים מקבילים, כך שהוא מתאים למשימות לוגיות מוגדרות היטב.

  • הרצה מקומית על שרת יחיד

    2.4 מיליארד פרמטרים פעילים מאפשרים לקבל תפוקה של מודל רחב על גבי כרטיס 40 גיגה בודד.

איפה זה נופל

זה מודל בסיס שלא עבר אימון שיחה או התאמה להוראות, ולכן הוא פשוט ימשיך טקסט ולא יענה לפקודות ישירות בלי כוונון מקדים. המפתחים עצמם מודים שהרצה שלו דרך transformers לא מותאמת ועובדת לאט, מה שמחייב שימוש בגרסאות מותאמות של vLLM. בנוסף, חלון ההקשר בטבלת המפרט מציין 32 אלף טוקנים בגרסה הזו לעומת חלונות ענקיים במודלים הגדולים יותר, ומבנה המומחים הייחודי מקשה על הרצה בספריות סטנדרטיות בלי קוד ייעודי.

אותה משפחה

DeepSeek-V2-Lite יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר לדבר איתו בצ'אט ישר אחרי ההורדה?

לא. זה מודל בסיס שנועד להשלמת טקסט או לאימון נוסף. אם אתם צריכים עוזר שיחה מוכן, עדיף להוריד את גרסת ה־Chat שמגיעה מאומנת עם תבניות שיחה.

איזה כרטיס מסך צריך בשביל להריץ אותו במחשב?

המודל תופס קרוב ל־30 גיגה של קבצים ומצריך מעבד גרפי אחד עם 40 גיגה זיכרון כדי לרוץ ב־bfloat16. כרטיסי מסך ביתיים רגילים של 16 או 24 גיגה לא יספיקו ללא קוונטיזציה.

איך מריצים

כדי להריץ אותו מקומית בפורמט bfloat16 מלא צריך כרטיס מסך יחיד עם לפחות 40 גיגה זיכרון. אם מתכננים אימון או התאמה אישית, הדרישה קופצת לשמונה כרטיסים של 80 גיגה. המפתחים מציינים שהרצה דרך ספריית transformers הרגילה סובלת מביצועים אטיים, וממליצים להשתמש בפתרון ייעודי מבוסס vLLM כדי לקבל מהירות סבירה.

גרסה זו היא מודל בסיס להשלמת טקסט ולא מיועדת לשיחה. אם אתם מחפשים מענה ישיר לשאלות של משתמשים בלי לאמן בעצמכם, הגרסה המותאמת לשיחה בשם Lite-Chat תתאים יותר. מי שאין לו שרת עם מעבד גרפי של 40 גיגה יעדיף להשתמש ב־API של החברה שתומך בממשק תואם OpenAI.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-V2-Lite")
print(pipe("שלום"))

הרישיון

הקוד בריפו מופץ תחת רישיון MIT, אך משקלי המודל עצמם כפופים להסכם רישיון ייעודי של החברה. הכרטיס מציין במפורש שהשימוש בדגמי הסדרה פתוח לשימוש מסחרי, אך מומלץ לקרוא את קובץ הרישיון המלא כדי לוודא שאין מגבלות הפצה ספציפיות לפני שילוב במוצר.

הרישיון המלא בעמוד המודל ↗