GPT
L

Llama-2-13B-GPTQ

קוד פתוח

TheBlokellama22023-07-18

  • transformers
  • safetensors
  • llama
  • text-generation
  • facebook

גרסה מכווצת בשיטת GPTQ של מודל הבסיס מבית מטא. היא דוחסת 13 מיליארד פרמטרים לנפח שרץ על כרטיס מסך ביתי יחיד בלי שחיקה מורגשת ביכולות.

  • 13Bפרמטרים
  • 4,096טוקנים בהקשר
  • 6.8 GBמשקל הקבצים
  • 425הורדות בחודש

מה זה

מדובר במודל הבסיס של Llama 2 בגודל 13B שעבר קוונטיזציה על ידי TheBloke כדי לאפשר הסקה מהירה על גבי כרטיסי מסך. להבדיל מגרסאות ה־Chat, המודל הזה לא עבר כוונון להוראות או שיחות, אלא מיועד להשלמת טקסט נטו או כבסיס לפיין טיונינג ייעודי.

במבחנים האקדמיים שפורסמו בכרטיס המקורי, מודל ה־13B מציג קפיצה ביחס לדור הראשון, עם 54.8 ב־MMLU ו־24.5 במבחני קוד. המשמעות בפועל היא שהוא מבין שפה והקשר ברמה סבירה בהרבה מגרסת ה־7B, אבל לא מתקרב ליכולות התכנות או ההיגיון המורכב של דגם ה־70B.

מתאים ל

  • השלמת טקסט באנגלית

    המשך פסקאות או מסמכים באנגלית על חומרת GPU ביתית בזכות כיווץ GPTQ.

  • בסיס לאימון מותאם

    פלטפורמה נוחה לפיין טיונינג למשימות ספציפיות שאינן דורשות את משקלי ה־Chat.

  • ניסויי הסקה מקומיים

    בדיקת ביצועים וארכיטקטורות של מודלי 13B במחשב מנותק מרשת חיצונית.

איפה זה נופל

זהו מודל בסיס ללא תבנית שיחה מובנית, ולכן הוא לא יענה לשאלות כמו צ'אטבוט אלא פשוט ימשיך את הטקסט שקיבל. מבחינת בטיחות, במדד ToxiGen מודל הבסיס הזה הגיע לציון רעילות של 26.10, לעומת 0.00 בגרסאות הצ'אט שעברו התאמה.

הכרטיס מדגיש שהשימוש מוגבל לאנגלית בלבד, ונתוני האימון נעצרו בספטמבר 2022. בעברית הוא כמעט ולא מתפקד, ומשימות שדורשות עובדות עדכניות או מענה לשאלות ישירות ייכשלו בלי אימון מקדים.

אותה משפחה

Llama-2 יצא ב־17 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם המודל יכול לשמש כעוזר אישי לשיחה?

לא באופן ישיר. זהו מודל שפה גולמי להשלמת טקסט שלא אומן בהנחיות שיחה. בשביל צ'אט צריך להוריד את גרסת Llama-2-13B-chat.

איזו גרסה מהרשימה כדאי להוריד להרצה מהירה?

ענף ה־main ב־4 ביט עם גודל קבוצה 128 מתאים לרוב המשתמשים. הוא שוקל 7.26 גיגה-בייט, נתמך במנוע ExLlama המהיר, וחוסך בזיכרון.

איך מריצים

גרסאות ה־4 ביט שוקלות בין 7.26 ל־8 גיגה-בייט, כך שכרטיס מסך עם 10 עד 12 גיגה-בייט זיכרון יריץ אותן בקלות דרך ExLlama או AutoGPTQ. אם בוחרים בגרסאות ה־8 ביט, הקבצים שוקלים סביב 13.6 גיגה-בייט ודורשים כרטיס של 16 או 24 גיגה-בייט, כאשר חלקן מציגות מהירות עבודה נמוכה יותר ב־CUDA.

ההרצה המקומית מתאימה למי שחייב פרטיות מוחלטת או עבודה ללא רשת. אם אין לכם חומרה ייעודית זמינה וקבועה, פנייה לשירותי ענן לפי שימוש תהיה זולה ופשוטה בהרבה מתחזוקת תשתית פרטית עבור מודל כזה.

from transformers import pipeline

pipe = pipeline("text-generation", model="TheBloke/Llama-2-13B-GPTQ")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון llama2 של מטא. הוא מתיר שימוש מחקרי ומסחרי, אך דורש הסכמה לתנאי השימוש ומדיניות השימוש ההוגן של מטא לפני הורדת המשקלים המקוריים.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗