GPT
L

NousResearch/Llama-2-13b-hf

קוד פתוח

NousResearchרישיון לא דווח2023-07-18

  • transformers
  • pytorch
  • safetensors
  • llama
  • text-generation

גרסת הבסיס של מודל השפה הפופולרי מבית מטא בגודל של 13 מיליארד פרמטרים. היא הוסבה לפורמט transformers ומתאימה בעיקר כחומר גלם לאימון עצמאי.

  • 13Bפרמטרים
  • 4,096טוקנים בהקשר
  • 72.7 GBמשקל הקבצים
  • 4,531הורדות בחודש

מה זה

מדובר במודל גולמי שאומן על 2 טריליון טוקנים, ללא התאמות ייעודיות לשיחה. הוא מספק המשכי טקסט נקיים יותר מגרסאות 7B ומשפר מדדים בכל קטגוריה בהשוואה לדור הקודם, כמו ציון MMLU של 54.8 מול 46.9 בגרסת 13B הראשונה. עם זאת, במבחני קוד כמו HumanEval ו־MBPP הוא מגיע לממוצע של 24.5 בלבד, כך שלא כדאי לבנות עליו לפיתוח תוכנה מורכב.

המודל אינו כולל Grouped-Query Attention, יכולת ששמורה בגרסה הזו רק לדגם ה־70B, ולכן תהליך ההסקה שלו דורש יותר משאבי זיכרון ככל שהטקסט מתארך. הוא תוכנן לקלוט ולהוציא טקסט באנגלית בלבד, עם חלון של 4,096 טוקנים.

מתאים ל

  • בסיס לאימון מותאם

    מתאים לחברות שרוצות לאמן מודל פנימי על דאטה ייעודי באנגלית ולא רוצות להתחיל מאפס.

  • מחקר אקדמי של מודלים

    מספק גרסה נקייה ללא התערבות של מנגנוני בטיחות ויישור אנושי, לצורך בדיקת ביצועים גולמיים.

  • השלמת טקסטים ייעודית

    עובד טוב במשימות של יצירת המשך לטקסט קיים ללא פורמט של שיחה או הוראה מפורשת.

איפה זה נופל

זהו מודל בסיס שלא עבר אימון עם משוב אנושי או כוונון להוראות. אם תשאלו אותו שאלה, סביר שהוא פשוט ימשיך לכתוב שאלות דומות במקום לענות. במבחן הרעילות ToxiGen הוא קיבל ציון של 26.10, גבוה יותר אפילו מגרסת ה־7B, והוא מועד להזיות עם 41.86 בלבד במבחן האמינות TruthfulQA. בנוסף, הוא נבדק ואומן רק באנגלית עם מידע שנעצר בספטמבר 2022, כך שעבור טקסטים בעברית הוא פשוט לא מתאים.

אותה משפחה

Llama-2 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה יודע לענות לשאלות כמו צ'אט?

לא. זהו מודל בסיס שלא עבר התאמה לשיחה, ולכן הוא לא מחזיר תשובות אלא ממשיך את הטקסט שקיבל. מי שמחפש ממשק שיחה צריך להשתמש בגרסת ה־Chat המכוונת.

האם כדאי להריץ אותו בעברית?

המודל אומן ונבדק באנגלית בלבד. שליחת פרומפטים בעברית תניב תוצאות שבורות, חצאי משפטים או הזיות גמורות, ולכן הוא אינו מתאים לשימוש מקומי בארץ.

איך מריצים

כדי להריץ אותו בדיוק המקורי של float16 תצטרכו לפחות 26 גיגה בייט של זיכרון כרטיס מסך נקי רק בשביל המשקלים, בלי לחשב את זיכרון ההקשר. כרטיס מקצועי יחיד כמו A100 או שני כרטיסי 24 גיגה בייט יספיקו לעבודה מקומית.

אם אתם לא מתכננים לאמן עליו משקלים משלכם, להחזיק תשתית כזו בשביל מודל בסיס לא מכויל זה בזבוז משאבים. במקרים שבהם המטרה היא רק לשלוח שאילתות, עדיף לפנות לפתרונות ענן קיימים.

from transformers import pipeline

pipe = pipeline("text-generation", model="NousResearch/Llama-2-13b-hf")
print(pipe("שלום"))

הרישיון

בעמוד המודל לא דווח רישיון מוגדר, אך לפי התיעוד השימוש כפוף לרישיון המסחרי המותאם של מטא. בפועל, אי אפשר להוריד ולהפיץ אותו ישירות למוצר בלי לקבל גישה רשמית ולאשר את התנאים באתר של מטא.

הרישיון המלא בעמוד המודל ↗