GPT
D

deepseek-moe-16b-chat

קוד פתוח

deepseek-aiother2024-01-09

  • transformers
  • safetensors
  • deepseek
  • text-generation
  • conversational

ארכיטקטורת תערובת מומחים שמביאה ביצועים של מודל גדול בחצי מעומס החישוב בזמן ריצה. פתרון מתאים למי שרוצה צ'אט עצמאי בלי לשלם על כל פרמטר בכל טוקן.

  • 16Bפרמטרים
  • 4,096טוקנים בהקשר
  • 30.5 GBמשקל הקבצים
  • 31,834הורדות בחודש

מה זה

מדובר במודל שיחה שמבוסס על ארכיטקטורת תערובת מומחים של כמעט 16.4 מיליארד פרמטרים. ההבדל הגדול בינו לבין מודלים רגילים באותו משקל הוא שבכל רגע נתון רק חלק מהמומחים מופעלים. זה נותן חיסכון ישיר בזמן עיבוד, כי המעבד הגרפי לא צריך להריץ את כל הרשת עבור כל מילה בודדת. המודל מיועד מראש ליישומי צ'אט והגיע מאומן כבר להוראות ושיח, בלי שתצטרכו לעשות לו התאמות מיוחדות כדי לדבר איתו.

הוא יצא בתחילת 2024 כחלק מגל הפיתוחים של דיפסיק, והיתרון הטכני שלו מתמקד ביעילות הסקה. הוא תומך באורך הקשר בסיסי של 4,096 טוקנים, שזה מספיק לשיחה רציפה או ניתוח טקסט בינוני, אבל לא יתאים למסמכי ענק. מי שמחפש מודל שרץ מהר יחסית לגודל הזיכרון שהוא תופס, ימצא כאן שילוב מעניין בין קיבולת למהירות תגובה.

מתאים ל

  • בוט שירות לקוחות

    מגיב מהר בזכות ארכיטקטורת המומחים ומתאים לדיאלוגים ממוקדים שלא דורשים הקשר ארוך.

  • הסקה על שרתים מקומיים

    חוסך זמני עיבוד בשרת ארגוני שחייב לשמור את המידע בפנים ולא להוציא החוצה ל־API.

  • מענה טכני וניסוח קצר

    מייצר תשובות מהירות לשאלות מוגדרות היטב במסגרת חלון ההקשר של 4,096 טוקנים.

איפה זה נופל

המגבלה הכי בולטת שהמפתחים מדגישים בעצמם היא אי תאימות להוראת מערכת. אסור להכניס system prompt בקלט כי המודל לא מתוכנת לטפל בו נכון, מה שמקשה לקבע לו אישיות או כללי התנהגות קשיחים. בנוסף, חלון ההקשר מוגבל ל־4,096 טוקנים בלבד, כך שטקסטים ארוכים ייחתכו מהר. צריך גם לזכור שאין נתונים על ביצועים בעברית, ולכן חובה לבדוק אותו מקומית לפני שמסתמכים עליו בעבודה עם שפה מקומית.

אותה משפחה

deepseek-moe יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר לתת למודל הוראת מערכת כדי להגדיר לו תפקיד?

לא מומלץ בכלל. המפתחים ציינו במפורש שגרסה זו אינה תואמת ל־system prompt, ולכן צריך להעביר הנחיות ישירות כחלק מהודעת המשתמש הראשונה.

איזה כרטיס מסך צריך כדי להריץ אותו כמו שהוא?

הקבצים שוקלים 30.5 גיגה בדיוק bfloat16, ולכן תצטרכו כרטיס עם לפחות 40 גיגה של זיכרון גרפי, או לחלק את המודל על פני שני כרטיסים של 24 גיגה.

איך מריצים

כדי להריץ אותו מקומית בדיוק המקורי של bfloat16 תצטרכו כרטיס מסך עם לפחות 40 גיגה זיכרון, כמו A100 או שני כרטיסי 24 גיגה מחוברים. המשקל הכולל של הקבצים מגיע ל־30.5 גיגה, מה שאומר שכרטיס ביתי סטנדרטי פשוט ייחנק בלי קוונטיזציה.

ההפעלה בקוד נעשית ישירות דרך ספריית transformers הרגילה של פייתון, בלי תלויות מוזרות. אם אין לכם שרת ייעודי שפועל רצוף, עדיף להשתמש בנקודת קצה מנוהלת במקום להחזיק חומרה כבדה ויקרה בשביל כמה קריאות ביום.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/deepseek-moe-16b-chat")
print(pipe("שלום"))

הרישיון

הקוד פתוח תחת רישיון MIT, אך משקלי המודל כפופים לרישיון ייעודי של דיפסיק שמוגדר כ־other. המפתחים מציינים במפורש שהוא תומך בשימוש מסחרי, אבל מחייבים לקרוא את קובץ התנאים המלא שלהם לפני שמשלבים אותו במוצר.

הרישיון המלא בעמוד המודל ↗