GPT
L

Llama-2-13B-chat-GPTQ

קוד פתוח

TheBlokellama22023-07-18

  • transformers
  • safetensors
  • llama
  • text-generation
  • facebook

גרסה מכווצת של המודל השיחתי מבית מטא שרצה על כרטיס מסך בודד. היא מתאימה למי שחייב שרת עצמאי לשיחות באנגלית בלי לשלם על חומרת קצה.

  • 13Bפרמטרים
  • 4,096טוקנים בהקשר
  • 6.8 GBמשקל הקבצים
  • 846הורדות בחודש

מה זה

מדובר בהמרה של Llama 2 בגודל 13 מיליארד פרמטרים לפורמט GPTQ, שמיועדת להסקה מהירה על כרטיסי מסך. המודל אומן מראש על 2 טריליון טוקנים ועבר כוונון ייעודי לשיחות בעזרת משוב אנושי. בבנצ'מרקים של מטא הוא מציג שיפור ניכר מול הדור הראשון, במיוחד במתמטיקה שבה הציון זינק מ־10.9 ל־28.7, וקוד שעלה ל־24.5. הנתונים האלה מעידים על יכולת טובה במשימות היגיון בסיסיות, אך הוא עדיין נשאר מודל קטן יחסית שלא מתחרה בביצועי גרסת ה־70B.

היתרון של הקובץ הנוכחי הוא חיסכון במשאבים. במקום משקל מלא שדורש זיכרון וידאו רב, הדחיסה ל־4 ביט מורידה את הנפח לאזור 7.26 גיגה בייט בגרסת ברירת המחדל, כך שאפשר להריץ צ'אט מקומי בלי להחזיק אשכול שרתים יקר.

מתאים ל

  • עוזר שיחה באנגלית

    הוא עבר כוונון ייעודי למענה מנומס ובטוח בדיאלוג ישיר עם משתמשים.

  • סיווג טקסט מקומי

    ביצועי שפה טובים באנגלית שרצים ישירות על שרת פנימי ללא תלות ברשת.

  • מענה מבוסס מסמכים קצרים

    הקשר של 4k מספיק לקטעי מידע ממוקדים בלי לחרוג ממגבלת הזיכרון.

איפה זה נופל

הכרטיס מגדיר שימוש בשפות שאינן אנגלית מחוץ לתחום המיועד, כך שעברית שבורה לחלוטין ולא תעבוד כאן באופן שמיש. חלון ההקשר מוגבל ל־4,096 טוקנים בלבד, מה שמקשה על שיחות ארוכות או ניתוח מסמכים כבדים. נקודת חיתוך המידע היא ספטמבר 2022, לכן אירועים מאוחרים יותר אינם מוכרים לו. בנוסף, חובה להקפיד על תבנית הפרומפט המדויקת עם תגיות המערכת וההוראות, אחרת איכות התשובות וההיצמדות להנחיות יורדות מיד.

אותה משפחה

Llama-2 יצא ב־17 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם המודל מבין ועונה בעברית בצורה תקינה?

לא. מטא הגדירה במפורש שכל שפה פרט לאנגלית נמצאת מחוץ לטווח השימוש של המודל. ניסיונות לעבוד איתו בעברית יפיקו טקסט משובש, איטי ולא מדויק.

באיזו גרסת קובץ כדאי לבחור מתוך הרשימה?

עבור רוב השימושים כדאי לקחת את גרסת 4 ביט עם group size 128 בענף main, מכיוון שהיא נתמכת היטב ב־ExLlama וצורכת מעט זיכרון עבודה. גרסאות 8 ביט תופסות כפול מקום ואינן מציגות פער איכות שמצדיק את אובדן המהירות.

איך מריצים

כדי להריץ את גרסאות ה־4 ביט תצטרכו כרטיס מסך צרכני עם לפחות 10 עד 12 גיגה בייט זיכרון וידאו פנוי, למשל דרך ExLlama או AutoGPTQ. גרסאות ה־8 ביט שבמאגר שוקלות קרוב ל־14 גיגה בייט ודורשות כרטיס של 16 או 24 גיגה בייט, כאשר חלקן סובלות מאיטיות משמעותית בעבודה עם CUDA.

אם אתם לא צריכים פרטיות מוחלטת והנתונים שלכם יכולים לצאת החוצה, עדיף לפנות ל־API חיצוני בתשלום לפי טוקן. להרים שרת ייעודי בשביל מודל 13B זה מהלך שמצדיק את עצמו רק אם יש דרישה רגולטורית להשאיר את המידע אצלכם בארגון.

from transformers import pipeline

pipe = pipeline("text-generation", model="TheBloke/Llama-2-13B-chat-GPTQ")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון llama2 הרשמי של מטא שמאפשר שימוש מסחרי ומחקרי באנגלית, אך כפוף למדיניות השימוש המקובל שלהם. בנוסף, כדי להוריד את המשקולות המקוריות נדרש אישור ישיר באתר של מטא. מי שמפתח מוצר ומגיע להיקף ענק של משתמשים פעילים בחודש יצטרך לבקש רישיון מיוחד ונפרד מהחברה.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗