GPT
D

DeciLM-6b

קוד פתוח

Decillama2,other2023-09-13

  • transformers
  • safetensors
  • deci
  • text-generation
  • Deci AI

מודל בסיס של 5.7 מיליארד פרמטרים שנבנה בארכיטקטורה מותאמת אישית למהירות. המטרה כאן היא לחתוך זמני ריצה ועלויות חומרה ביחס למודלים מקבילים.

  • 5.7Bפרמטרים
  • 4,096טוקנים בהקשר
  • 10.7 GBמשקל הקבצים
  • 111הורדות בחודש

מה זה

מדובר במודל שנועד ליצירת טקסט באנגלית, שהופק באמצעות טכנולוגיית חיפוש ארכיטקטורה של דסי בשם AutoNAC. השינוי המרכזי מול מודלים סטנדרטיים בגודל הזה הוא שימוש במנגנון תשומת לב מסוג Grouped-Query Attention עם כמות ראשים משתנה בין 32 השכבות. האימון הראשוני נעשה על חלק ממאגר SlimPajamas.

מבחינת ביצועים ודיוק, המודל מציג ממוצע של 60.33 במבחני ההערכה המקובלים, עם תוצאות כמו 74.58 ב־HellaSwag ו־71.01 ב־BoolQ. מה שבאמת מעניין את החברה זו מהירות הפליטה: לפי הבדיקות שלהם על כרטיס A10, הוא מגיע לקצב של עד פי 15 לעומת Llama 2 7B, ומפיק 652.49 טוקנים לשנייה תחת PyTorch עם גודל אצווה 64, או 2,029.6 טוקנים לשנייה במנוע Infery LLM עם גודל אצווה 128.

מתאים ל

  • בסיס לכוונון עצמאי

    נקודת מוצא טובה לאימון על דאטה פנימי באנגלית, בזכות ארכיטקטורה קלה ויעילה שמקצרת זמני אימון.

  • השלמת טקסט מהירה

    מתאים לשרתים שצריכים לייצר כמויות טקסט גבוהות, בזכות קצב של 652.49 טוקנים לשנייה ב־PyTorch על A10.

  • עיבוד אצוות גדולות

    שילוב של GQA משתנה מאפשר להריץ אצוות של 64 או 128 בלי לחנוק את זיכרון כרטיס המסך.

איפה זה נופל

זהו מודל בסיס בלבד, מה שאומר שהוא ימשיך טקסט ולא יענה להוראות או שאלות בלי שתכוונו אותו או תשתמשו בגרסת ההוראות. המבחנים שלו חושפים חולשות בוטות: ציון של 36.19 ב־TruthfulQA ו־34 בלבד ב־OpenBookQA מראים שהוא נוטה להזיות ולא מחזיק ידע עובדתי מדויק. בנוסף, המודל אומן על אנגלית בלבד ולא מתאים לעברית מהקופסה.

אותה משפחה

DeciLM יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה מבין עברית?

לא. המודל הוגדר ואומן על נתונים באנגלית בלבד. אם תרצו להשתמש בו לעברית, תצטרכו לבצע כוונון מקיף בעצמכם על נתונים מקומיים.

האם אפשר להשתמש בו ישר כעוזר אישי או צ׳אטבוט?

לא מומלץ. מדובר במודל בסיס שמשלים משפטים ולא עבר אימון שיחה. למטרות שיחה והוראות עדיף להוריד את DeciLM 6B-Instruct.

למה חובה להשתמש בפרמטר trust_remote_code בטעינה?

מפני שהארכיטקטורה כוללת מנגנון GQA ייחודי שפותח בטכנולוגיית AutoNAC, שאינו חלק מובנה בקוד הסטנדרטי של ספריית transformers.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך עם זיכרון שמחזיק קבצים במשקל 10.7 GB בפורמט bfloat16, למשל כרטיס כמו A10 שבו נבדקו המדדים. הריצה בקוד מתבצעת ישירות דרך ספריית transformers עם פקודת AutoModelForCausalLM, אבל חובה להגדיר trust_remote_code=True בגלל המבנה הייחודי של השכבות.

אם כל מה שצריך זה לתת הוראות בצ׳אט, אין סיבה להריץ את הגרסה הזו. המודל הזה הוא מודל בסיס של השלמת טקסט, ודסי עצמם שחררו גרסה נפרדת בשם DeciLM 6B-Instruct שעברה כוונון ייעודי למילוי הוראות עם LoRA.

from transformers import pipeline

pipe = pipeline("text-generation", model="Deci/DeciLM-6b")
print(pipe("שלום"))

הרישיון

הרישיון מבוסס על רישיון הקהילה של Llama 2 עם תוספת מגבילה של דסי שמיועדת לספקי שירותי אירוח. הוא מאפשר שימוש מסחרי ומחקרי, אבל מחייב עמידה בתנאי השימוש של מטא לצד התנאים של דסי לגבי פלטפורמות ענן.

הרישיון המלא בעמוד המודל ↗