GPT
D

deepseek-llm-7b-base

קוד פתוח

deepseek-aiother2023-11-29

  • transformers
  • pytorch
  • llama
  • text-generation
  • text-generation-inference

מודל בסיס פתוח של שבעה מיליארד פרמטרים, שאומן מאפס על שני טריליון טוקנים באנגלית ובסינית. הוא מיועד למי שרוצה לאמן או לכוונן מודל עצמאי ולא להסתמך על צ'אט סגור.

  • 4,096טוקנים בהקשר
  • 12.9 GBמשקל הקבצים
  • 30,974הורדות בחודש
  • 146לייקים

מה זה

מדובר במודל שפת בסיס שמשתמש בארכיטקטורת LlamaForCausalLM עם Multi-Head Attention וכולל שלושים שכבות. הוא אומן מאפס על מאגר של שני טריליון טוקנים שמתמקד בשתי שפות בלבד, אנגלית וסינית. הוא לא מגיע מחומם לצ'אט ולא עבר התאמות של הוראות, אלא פשוט מנחש את הטוקן הבא ברצף הטקסט.

המשמעות של מודל בסיס כזה היא שאתם מקבלים חומר גלם נקי יחסית לאימון המשך או כיוונון עדין. הוא לא ינסה להיות מנומס, הוא לא יענה כמו עוזר וירטואלי, אלא ישלים טקסט ישירות לפי ההקשר שקיבל, מה שהופך אותו לבסיס פרקטי למשימות ספציפיות שדורשות שליטה מלאה.

מתאים ל

  • אימון מודלים מותאמים

    משמש כנקודת מוצא גולמית לכיוונון עדין של משימות עסקיות ספציפיות.

  • השלמת טקסט באנגלית ובסינית

    אומן על שני טריליון טוקנים בשפות אלו ומייצר השלמות טקסט ישירות.

  • מחקר עצמאי של ארכיטקטורה

    מאפשר לבחון התנהגות של מודל בסיס נקי מבוסס Llama ללא התערבות צ'אט.

איפה זה נופל

חלון ההקשר מוגבל לארבעת אלפים תשעים וששה טוקנים בלבד, כך שהוא לא יתאים למסמכים ארוכים או לספריות קוד שלמות. מעבר לזה, הוא אומן רק על אנגלית וסינית, ולכן אין מה לבנות עליו למשימות בעברית ללא אימון נוסף. מכיוון שמדובר במודל בסיס, הוא עלול לפלוט טקסטים חזרתיים, שגיאות בוטות או שטויות אם לא מגדירים נכון את פרמטרי היצירה.

אותה משפחה

deepseek-llm יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר לדבר עם המודל הזה בצ'אט?

לא בצורה ישירה. זהו מודל בסיס שמנחש את המשך הטקסט ולא מודל שעבר התאמה לשיחה. אם תשאלו אותו שאלה, הוא עשוי להמשיך לייצר שאלות דומות במקום לענות, ולכן לשיחות עדיף לפנות לגרסת הצ'אט שלו.

המודל מבין עברית?

האימון הרשמי התמקד רק באנגלית ובסינית על פני שני טריליון טוקנים. הוא לא אומן על עברית, ולכן לא מומלץ להסתמך עליו לפרויקטים מקומיים בלי לאמן אותו קודם על דאטה רלוונטי.

איך מריצים

המשקל הכולל של הקבצים עומד על כמעט שלושה עשר גיגה בייט בפורמט bfloat16, כך שתצטרכו כרטיס מסך עם לפחות שישה עשר גיגה זיכרון כדי להריץ אותו ישירות בלי קוונטיזציה. הטעינה מתבצעת בספריית transformers הסטנדרטית באמצעות פייתון, עם AutoModelForCausalLM והגדרה פשוטה של מיפוי החומרה.

אם אתם מחפשים רק מענה לשאלות משתמשים בלי כוונון מקדים, אין טעם להרים שרת בשביל גרסת הבסיס הזו. במצב כזה עדיף לקחת את גרסת הצ'אט שפורסמה במקביל, או לפנות לממשק רשת קיים ולחסוך תחזוקה של תשתית עצמאית.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/deepseek-llm-7b-base")
print(pipe("שלום"))

הרישיון

הקוד בריפו מוגדר תחת רישיון MIT, אך משקלי המודל עצמם כפופים לרישיון ייעודי של החברה שתויג כ־other. הכרטיס מצהיר שהשימוש המסחרי מותר, אך מחייב בדיקה של תנאי הרישיון המלאים של המודל לפני הפצה במוצר.

הרישיון המלא בעמוד המודל ↗