GPT
L

Llama-2-70B-Chat-GPTQ

קוד פתוח

TheBlokellama22023-07-18

  • transformers
  • safetensors
  • llama
  • text-generation
  • facebook

גרסה מכווצת של מודל השיחה הגדול מבית מטא, שדוחסת 69 מיליארד פרמטרים לנפח זיכרון מעשי. היא נועדה למי שחייב להריץ מודל חזק על חומרה מקומית בלי לאבד יותר מדי דיוק.

  • 69Bפרמטרים
  • 4,096טוקנים בהקשר
  • 32.9 GBמשקל הקבצים
  • 961הורדות בחודש

מה זה

מדובר בהמרה של מודל השיחה מטא בנפח 69 מיליארד פרמטרים לפורמט GPTQ, שביצע TheBloke כדי לאפשר הרצה על כרטיסי מסך בפחות זיכרון. המודל המקורי אומן על שני טריליון טוקנים ועבר כוונון לשיחה עם משוב אנושי. בבדיקות של מטא גרסת הבסיס שלו הגיעה לציון 68.9 ב־MMLU וציון 37.5 בקוד, והיא מובילה משמעותית על פני הגרסאות הקטנות יותר של אותה משפחה. בבדיקות בטיחות של גרסת השיחה הזו נמדד ציון של 64.14 באמינות מול 57.04 בגרסת שבעת המיליארדים, עם שיעור רעילות כמעט אפסי של 0.01.

ההבדל העיקרי כאן הוא הדחיסה לגרסאות של 4 ביט ו־3 ביט. במקום להחזיק משקלים מלאים שדורשים חומרה יקרה בהרבה, הכיווץ מוריד את נפח הקבצים לכ־27 עד 40 גיגה-בייט, תלוי ברמת הדיוק וקבוצת הבלוקים שנבחרה. זה מאפשר לקבל יכולות ניסוח והבנה מורכבות של מודל ענק על שרת מקומי, במחיר של פגיעה קלה בלבד בדיוק המקורי.

מתאים ל

  • עוזר שיחה פנימי באנגלית

    המודל אומן עם משוב אנושי לשיחות מורכבות, ומספק מענה בטוח יחסית בתוך ארגון שמחזיק שרת פרטי.

  • הסבר וניתוח קוד

    עם ציון 37.5 במבחני קוד אקדמיים, הוא מציג יכולת ניתוח גבוהה בהרבה מהגרסאות הקטנות של הסדרה.

  • עיבוד טקסטים רגישים

    מאפשר להריץ מודל של 69 מיליארד פרמטרים על תשתית מקומית סגורה לחלוטין בלי להוציא מידע החוצה.

איפה זה נופל

חלון ההקשר מוגבל ל־4,096 טוקנים בלבד, מה שמקשה מאוד על ניתוח מסמכים ארוכים או שיחות מתמשכות. מעבר לזה, המודל אומן ונבדק על טקסטים באנגלית בלבד, ויוצריו מציינים במפורש שכל שפה אחרת נמצאת מחוץ לטווח השימוש המיועד שלו, כך שאינו מתאים לעברית. תאריך היעד של נתוני האימון מסתיים בספטמבר 2022 עבור רוב המידע, וחלק מנתוני הכוונון מעודכנים רק עד יולי 2023.

אותה משפחה

Llama-2 יצא ב־17 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

כמה זיכרון גרפי צריך כדי להריץ את הגרסה הראשית?

הקובץ הראשי שוקל 35.33 גיגה-בייט, ולכן דרוש כרטיס עם זיכרון גרפי שגדול מזה, או חיבור של שני כרטיסים במקביל כדי לתת מענה גם לטעינת ההקשר בריצה. אם הזיכרון גבולי, אפשר להשתמש בגרסאות ה־3 ביט ששוקלות פחות מ־30 גיגה-בייט, אך הן לא תומכות במנוע ExLlama.

האם המודל מבין ומייצר עברית כמו שצריך?

לא. כרטיס המודל מגדיר את השימוש באנגלית בלבד ומציין במפורש ששפות אחרות הן מחוץ לתחום. אימון המודל לא כוון לעברית, ולכן לא מומלץ להסתמך עליו למשימות בשפה זו.

איך מריצים

בפועל תצטרכו כרטיס מסך או שילוב כרטיסים עם זיכרון גרפי של 35 עד 48 גיגה-בייט לפחות, רק כדי לטעון את המשקלים ולהשאיר מקום לחלון הריצה. גרסת ברירת המחדל תופסת 35.33 גיגה-בייט ב־4 ביט ועובדת עם ExLlama, בעוד שגרסאות 3 ביט יורדות עד 26.78 גיגה-בייט אך לא נתמכות שם ואיכותן נמוכה יותר. גרסת האיכות המרבית מגיעה ל־40.66 גיגה-בייט.

טוענים את הקבצים דרך ממשק text-generation-webui או בסקריפט פייתון שמשתמש בספריות transformers בגרסה 4.32.0 ומעלה יחד עם auto-gptq. אם אין לכם גישה לשרת עם זיכרון גרפי כזה, כדאי לשקול קריאה למודל מנוהל בענן, כי הרצה עצמית של מודל כזה תגרור עלויות שרתים ניכרות בכל חודש.

from transformers import pipeline

pipe = pipeline("text-generation", model="TheBloke/Llama-2-70B-Chat-GPTQ")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון llama2 של מטא, והוא מתיר שימוש מחקרי ומסחרי. תנאי השימוש דורשים לקבל את הרישיון באתר של מטא לפני ההורדה, ומגבילים את ההפעלה לשימושים חוקיים באנגלית לפי מדיניות השימוש שלהם.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗