GPT
L

Llama-2-7B-32K-Instruct

קוד פתוח

togethercomputerllama22023-08-08

  • transformers
  • pytorch
  • llama
  • text-generation
  • en

גרסת שיחה של לאמה 2 שמרחיבה את הזיכרון ל־32 אלף טוקנים. פתרון מתאים למי שחייב לעבד מסמכים ארוכים על כרטיס מסך בודד ובלי תלות ב־API סגור.

  • 32,768טוקנים בהקשר
  • 12.6 GBמשקל הקבצים
  • 783הורדות בחודש
  • 160לייקים

מה זה

המודל לוקח את הבסיס המוכר של לאמה 2 בגודל 7 מיליארד פרמטרים ומותח את טווח הקריאה שלו פי שמונה, לתוך חלון של 32,768 טוקנים. כדי להפוך אותו לשימושי בצ'אט ובהוראות, החברה אימנה אותו על שילוב של 19 אלף שיחות שחולצו ממודל גדול יותר, יחד עם נתוני סיכום של ספרים ומענה לשאלות מתוך מספר מסמכים במקביל.

במבחני הביצועים מול מודלים פתוחים אחרים בגודל הזה, הוא מציג יתרון ברור בעיבוד טקסט ארוך. במבחן סיכום הספרים הוא עקף את הגרסה המקורית של מטא וגם את גרסאות לונגצ'אט, והגיע לציונים דומים ואף מעט טובים יותר מ־GPT-3.5 בגרסת ה־16K שלו. במענה על שאלות מתוך 50 מסמכים הוא שמר על דיוק של קרוב ל־59 אחוז, בזמן שהמודל הרגיל של מטא צנח לאזור ה־35 אחוז בגלל מגבלת החלון.

מתאים ל

  • סיכום דוחות ומסמכים ארוכים

    מאפשר להזין עשרות עמודים באנגלית ברצף ולקבל תמצית מרוכזת בלי לחתוך את הטקסט לחלקים קטנים.

  • שאלות ותשובות מרובות מקורות

    מאתר מידע מתוך ערימת מסמכים שהוזנה בבת אחת, תכונה שהציגה דיוק של מעל 58 אחוז גם ב־50 מקורות במקביל.

  • עוזר שיחה לטקסטים מורכבים

    מחזיק שיחה ארוכה במיוחד עם הקשר רחב מבלי לאבד פרטים שנאמרו בתחילת הדיאלוג.

איפה זה נופל

הכרטיס מודה בלקוניות שהמודל עלול לייצר תוכן שגוי או מוטה, אך הבעיה האמיתית היא נתוני האימון. המודל אומן על אנגלית בלבד, כך שאינו מתאים לעיבוד טקסטים בעברית ללא אימון נוסף. בנוסף, חצי מדאטה האימון מבוסס על זיקוק פלט ממודל אחר, מה שלעיתים מייצר תשובות שנשמעות בטוחות בעצמן אך חסרות דיוק עובדתי אמיתי במשימות מורכבות.

אותה משפחה

Llama-2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה תומך בעברית?

המודל מוגדר ומאומן רשמית עבור השפה האנגלית בלבד. הוא לא יבין פניות מורכבות בעברית ואינו מיועד לפרויקטים מקומיים בשפה זו ללא כוונון נוסף.

מה החומרה המינימלית להרצה מקומית?

המשקולות לבדן תופסות כ־12.6 גיגה בייט. להרצה יציבה שמנצלת את מלוא 32 אלף הטוקנים תצטרכו כרטיס מסך מודרני עם 24 גיגה זיכרון ויותר, יחד עם התקנה של Flash Attention 2.

במה הוא עדיף על המודל המקורי של מטא?

הדגם המקורי של מטא מוגבל לחלון הקשר קצר בהרבה ונכשל בסיכום טקסטים ארוכים. הגרסה הזו שומרת על יכולת השיחה אך מעבדת פי שמונה יותר מידע בבת אחת.

איך מריצים

כדי להריץ אותו מקומית צריך כרטיס מסך עם לפחות 16 עד 24 גיגה זיכרון כדי להחזיק את 12.6 הגיגה של המשקולות בפורמט float16, ועוד מרווח עבור הזיכרון של ההקשר הארוך. ההרצה דורשת התקנה של Flash Attention בגרסה 2 יחד עם ספריות ייעודיות לחישובי מיקום, בלי זה המהירות תצנח והזיכרון ייגמר מהר מאוד.

המפתחים מעמידים גם אפשרות לגשת אליו דרך ה־API והסביבה של החברה עצמה. אם המטרה היא רק לבדוק שאילתות בודדות או שאין ברשותכם שרת ייעודי עם חומרה מתאימה להחזקת 32 אלף טוקנים בזיכרון, עדיף לשלם לפי קריאה ולא לתחזק שרת כבד באופן קבוע.

from transformers import pipeline

pipe = pipeline("text-generation", model="togethercomputer/Llama-2-7B-32K-Instruct")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון לאמה 2 של מטא. הוא מתיר שימוש מסחרי ומחקר באופן חופשי לרוב החברות, אך מטיל מגבלות מיוחדות אם השירות שלכם מגיע ליותר מ־700 מיליון משתמשים פעילים בחודש, ודורש עמידה במדיניות השימוש המקובלת של מטא.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗