GPT
D

deepseek-llm-67b-chat

קוד פתוח

deepseek-aiother2023-11-29

  • transformers
  • pytorch
  • llama
  • text-generation
  • conversational

מודל שיחה פתוח עם 67 מיליארד פרמטרים שאומן מאפס על אנגלית וסינית. הוא פונה למי שמחפש אלטרנטיבה כבדה למודלים הקיימים ומוכן לשלם על זה בחומרה רצינית.

  • 4,096טוקנים בהקשר
  • 126 GBמשקל הקבצים
  • 1,226הורדות בחודש
  • 207לייקים

מה זה

מדובר במודל שיחה שצמח מתוך גרסת בסיס של 67 מיליארד פרמטרים, ועבר כוונון ייעודי על הוראות ושיחות. תהליך האימון שלו נעשה מאפס על מאגר נתונים של שני טריליון טוקנים, שמתחלקים בין אנגלית לסינית. המבנה הפנימי נשען על ארכיטקטורת LlamaForCausalLM עם תשעים וחמש שכבות, מה שמציב אותו ישירות מול משקלים כבדים אחרים בקטגוריית הקוד הפתוח.

בניגוד לגרסת הבסיס שנועדה להשלמת טקסט כללית, גרסת הצ'אט מגיעה עם תבנית שיחה מוגדרת מראש שמוכנה לעבודה ישירה מול משתמש. הדגש כאן הוא על שילוב חזק בין שתי השפות המרכזיות שעליהן הוא אומן, בלי יומרה לכסות עשרות שפות אחרות ברמה גבוהה. אין בכרטיס טבלאות ביצועים מפורטות או השוואות למבחנים סטנדרטיים, כך שאת היכולת האמיתית שלו במשימות מורכבות צריך לבדוק ישירות מול הפרומפטים שלכם.

מתאים ל

  • עיבוד טקסטים בסינית

    הוא אומן על שני טריליון טוקנים עם מיקוד חזק בסינית ואנגלית, ולכן מתאים למשימות תרגום וניתוח בשפות האלו.

  • בוט שיחה באנגלית

    גרסת הצ'אט מכווננת להוראות ומציעה נפח פרמטרים גדול לתשובות מורכבות, כל עוד שומרים על חלון קצר.

  • אימון והתאמה פנימית

    הארכיטקטורה הסטנדרטית מאפשרת לבצע fine-tuning על גבי מודל כבד שכבר אומן היטב מאפס.

איפה זה נופל

המגבלה הכי בולטת של המודל היא חלון הקשר של 4,096 טוקנים בלבד. אי אפשר להעמיס עליו מסמכים ארוכים, קבצי קוד גדולים או היסטוריית שיחה מתמשכת. מעבר לזה, המפתחים מזהירים במפורש לא להשתמש ב־system prompt בגרסה הזו כי הוא פשוט לא נתמך וישבש את התוצאות. המודל אומן רק על אנגלית וסינית, כך שאין מה לבנות עליו לעברית טובה בלי בדיקה מעמיקה.

אותה משפחה

deepseek-llm יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להגדיר לו הנחיות מערכת קבועות בשיחה?

לא. המפתחים מדגישים בכרטיס המודל שהגרסה הזו אינה תואמת לשימוש ב־system prompt. כל ניסיון לדחוף הנחיה כזו לתוך הפורמט עלול לפגוע באיכות התשובות, ולכן צריך לנסח את כל ההוראות כחלק מההודעה הרגילה של המשתמש.

כמה זיכרון וידאו צריך בפועל כדי לעבוד איתו?

המשקלים שוקלים מאה עשרים ושישה גיגה בייט בדיוק של bfloat16. להרצה בסיסית תצטרכו לפחות שני כרטיסי A100 של שמונים גיגה בייט או ארבעה כרטיסים של ארבעים גיגה בייט, וזה עוד לפני שמחשבים את הזיכרון הנוסף שדורש ה־KV cache בזמן יצירת טקסט.

איך מריצים

כדי להרים אותו מקומית צריך להוריד מאה עשרים ושישה גיגה בייט של קבצים בפורמט bfloat16. זה דורש כמה כרטיסי מסך חזקים עם זיכרון כולל של לפחות מאה ארבעים גיגה בייט רק כדי לטעון את המשקלים לזיכרון לפני שבכלל מייצרים טוקן ראשון. בספריית transformers טוענים אותו ישירות דרך AutoModelForCausalLM עם חלוקה אוטומטית לכרטיסים.

אם אין לכם שרת ייעודי כזה בחצר, הרצה עצמית תעלה אלפי דולרים בחודש בענן. במקרים כאלה עדיף לבדוק אם יש שירות מנוהל שמוכר קריאות לפי טוקן, או להשתמש בגרסת הצ'אט שהמפתחים מעמידים ברשת, במקום לשלם על שרתים שיעמדו בלי מעש רוב הזמן.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/deepseek-llm-67b-chat")
print(pipe("שלום"))

הרישיון

הקוד במאגר פתוח תחת רישיון MIT, אבל המשקלים עצמם מוגדרים תחת רישיון מודל נפרד שהמפתחים מכנים Model License. לפי הכרטיס המודל תומך בשימוש מסחרי, אך הוא כפוף לתנאים ספציפיים שמופיעים בקובץ החוזה שלהם בגיטהאב. מי שרוצה לשלב אותו במוצר חייב לקרוא את המסמך המקורי כדי להבין את המגבלות המדויקות.

הרישיון המלא בעמוד המודל ↗