GPT
D

deepseek-moe-16b-base

קוד פתוח

deepseek-aiother2024-01-08

  • transformers
  • safetensors
  • deepseek
  • text-generation
  • custom_code

מודל בסיס בארכיטקטורת תערובת מומחים של כ־16 מיליארד פרמטרים. הוא מיועד למי שמחפש נקודת מוצא גולמית לאימון או התאמה אישית, ולא צ'אטבוט מוכן מהקופסה.

  • 16Bפרמטרים
  • 4,096טוקנים בהקשר
  • 30.5 GBמשקל הקבצים
  • 10,892הורדות בחודש

מה זה

מדובר במודל שפה מבוסס ארכיטקטורת MoE שיצא בתחילת 2024. הרעיון במבנה כזה הוא חלוקת העבודה בין רשתות מומחים קטנות בתוך 28 השכבות שלו, במקום להפעיל את כל 16 מיליארד הפרמטרים בכל מילה ומילה שהוא פולט. זה מאפשר לחסוך בכוח חישוב בזמן היצירה לעומת מודלים צפופים בגודל דומה.

הוא מוגדר כמודל בסיס ולא עבר כוונון להוראות או שיחה. המשמעות היא שהוא מיועד להשלמת טקסט טבעית לפי ההקשר שתתנו לו. אם תזרקו עליו שאלה ישירה בלי הכוונה, סביר להניח שהוא ימשיך את השאלה במקום לענות עליה, ולכן הוא רלוונטי בעיקר למי שמתכנן לעשות לו כוונון עדין למשימות מוגדרות.

מתאים ל

  • אימון מודל מותאם אישית

    נקודת פתיחה טובה לכוונון על דאטה ארגוני פנימי בזכות ארכיטקטורת מומחים יעילה.

  • השלמת טקסט טכני

    יצירת המשכים לפסקאות או קטעי קוד מוגדרים במערכות שלא דורשות ממשק של צ'אט.

  • מחקר על ארכיטקטורות MoE

    בדיקת התנהגות וניתוב של מודלי תערובת מומחים בסביבה מקומית בלי תלות בגורם חיצוני.

איפה זה נופל

זה מודל בסיס טהור, אז אין פה שום סינון, עידון או הבנה של שיחה, והוא לא מוכן לעבודה ישירה מול משתמשים. חלון ההקשר מוגבל ל־4,096 טוקנים בלבד, שזה מעט מאוד למשימות מודרניות של קריאת מסמכים ארוכים או ניתוח קוד מורכב. בנוסף, אין בכרטיס המודל נתונים או בדיקות לגבי יכולות בשפות שאינן אנגלית או סינית, כך שאם אתם בונים על עברית ברמה גבוהה תצטרכו לבדוק את הטוקנייזר והביצועים בעצמכם לפני שתתחילו פרויקט.

אותה משפחה

deepseek-moe יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להשתמש בו ישירות לצ'אט עם לקוחות?

לא. מדובר במודל בסיס שלא עבר התאמה לשיחות או מענה לשאלות. הוא ינסה להשלים את המשפט של המשתמש במקום לענות לו, ועשוי לפלוט תוכן לא צפוי.

כמה זיכרון וידאו צריך כדי להריץ אותו?

המשקלים תופסים מעל 30 ג'יגה בפורמט המקורי. תצטרכו כרטיס מסך של 40 ג'יגה לפחות, או לחלופין לפצל אותו על פני שני כרטיסי 24 ג'יגה כדי לקבל ביצועים סבירים.

איך מריצים

כדי להעלות אותו בזיכרון בדיוק bfloat16 תצטרכו לפחות 32 ג'יגה זיכרון גרפי, ועדיף כרטיס מקצועי של 40 ג'יגה כמו A100 או זוג כרטיסים צרכניים כדי שיישאר מקום לטוקנים ולחישובים עצמם. המודל שוקל מעל 30 ג'יגה שמחולקים ל־16 קבצים, כך שזמן הטעינה הראשוני דורש רוחב פס סביר וסבלנות.

ההרצה נעשית ישירות דרך ספריית transformers של פייתון עם פקודות AutoModel וטעינה אוטומטית למעבדים הגרפיים. אם אין לכם גישה לחומרה כזו או שאתם לא צריכים לאמן עליו שכבות משלכם, החזקת שרת ייעודי למודל בסיס בגודל הזה תהיה בזבוז תקציב לעומת שימוש במודלי קצה שזמינים ברשת.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/deepseek-moe-16b-base")
print(pipe("שלום"))

הרישיון

הקוד בריפו מוגדר תחת רישיון MIT, אבל המשקלים של המודל עצמו כפופים לרישיון מותאם אישית בשם Model License. היוצרים מציינים שהשימוש המסחרי מותר, אך מחייבים לעיין בתנאי הקובץ הייעודי שלהם בגיטהאב כדי לוודא שאין הגבלות שימוש ספציפיות על המוצר שאתם מפתחים.

הרישיון המלא בעמוד המודל ↗