GPT
L

Llama-2-7B-Chat-GPTQ

קוד פתוח

TheBlokellama22023-07-18

  • transformers
  • safetensors
  • llama
  • text-generation
  • facebook

גרסת GPTQ מכווצת של המודל השיחתי מבית מטא. שוקלת סביב 4 גיגהבייט ורצה מקומית על כרטיס מסך בודד ופשוט.

  • 6.7Bפרמטרים
  • 4,096טוקנים בהקשר
  • 3.6 GBמשקל הקבצים
  • 6,966הורדות בחודש

מה זה

מדובר במודל שיחה מכווץ ל־4 ביט שמבוסס על שבעה מיליארד הפרמטרים של מטא. TheBloke לקח את המשקלים המקוריים והמיר אותם כדי לחסוך זיכרון ולהאיץ את מהירות הפלט על גבי מאיצים גרפיים.

הוא מיועד למשימות שיחה, מענה לשאלות ועיבוד טקסט באנגלית לפי תבנית הנחיות מוגדרת. במבחנים המקוריים של מטא גרסת שבעה מיליארד קיבלה ציון 16.8 בקוד ו־14.6 במתמטיקה, שזה חלש ומראה שהוא לא מתאים לפיתוח תוכנה או חישובים מורכבים. מנגד, במבחני הבנת הנקרא עם ציון 61.3 ורמת רעילות אפסית במדד Toxigen, הוא מציג בסיס יציב לשיחה בטוחה שלא דורשת חשיבה אנליטית כבדה.

מתאים ל

  • בוט שיחות פנימי באנגלית

    צורך מעט זיכרון ויכול לשמש כעוזר אישי באנגלית על חומרה זולה.

  • בדיקת פרומפטים מקומית

    מאפשר לבחון תבניות פנייה ומבנה שיחה בלי לשלם על קריאות רשת.

  • מיון וסיכום טקסטים קצרים

    מתאים לסיווג נתונים וניתוח פסקאות שלא דורשים זיכרון עבודה גדול.

איפה זה נופל

המודל אומן ונבדק באנגלית בלבד, וכל שימוש בשפות אחרות כמו עברית מוגדר במפורש מחוץ לטווח השימוש התקין שלו. מעבר לזה, הביצועים שלו במשימות קוד ופתרון בעיות מתמטיות נמוכים מאוד. הכרטיס מזהיר גם מהטיות ומהזיות, וחלון ההקשר עומד על 4,096 טוקנים בלבד, מה שמקשה על עיבוד מסמכים ארוכים.

אותה משפחה

Llama-2 יצא ב־17 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אפשר להריץ את המודל על מעבד רגיל ללא כרטיס מסך?

הקבצים כאן נוצרו בפורמט GPTQ שמיועד ספציפית למאיצים גרפיים. בשביל הרצה על מעבד רגיל תצטרכו להוריד את גרסאות ה־GGUF של אותו מודל.

האם הוא יעבוד טוב בעברית?

לא. מטא הגדירה במפורש שפות שאינן אנגלית מחוץ לטווח הפעולה, והאימון שלו לא כלל בדיקות איכות או בטיחות בעברית.

איך מריצים

טוענים את המשקלים עם ספריות כמו Transformers, AutoGPTQ או ExLlama שנותנת ביצועים מעולים על מודלים של Llama ב־4 ביט. הקבצים שוקלים בין 3.9 ל־4.3 גיגהבייט בהתאם לענף שבוחרים, כך שכרטיס מסך צרכני עם 6 או 8 גיגהבייט זיכרון יריץ אותם בלי בעיה.

ההבדלים בין הגרסאות נובעים מפרמטר ה־group size, כאשר 32g נותן איכות מעט טובה יותר ותופס יותר מקום, ו־128g חוסך יותר זיכרון. אם אין לכם שום כרטיס מסך תואם או שאתם בונים שירות שצריך לעמוד בעומס משתמשים רחב, עדיף לפנות ל־API חיצוני מוכן במקום להחזיק שרת ייעודי.

from transformers import pipeline

pipe = pipeline("text-generation", model="TheBloke/Llama-2-7B-Chat-GPTQ")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון מסחרי ייעודי של מטא עבור Llama 2. הוא דורש קבלת תנאי השימוש באתר של מטא לפני ההורדה, ומגביל שימוש באפליקציות שמפרות את מדיניות השימוש המקובלת שלהם או שפועלות בשפות שאינן אנגלית.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗