GPT
L

Llama-2-7B-GPTQ

קוד פתוח

TheBlokellama22023-07-18

  • transformers
  • safetensors
  • llama
  • text-generation
  • facebook

גרסה מכווצת בפורמט GPTQ של מודל הבסיס של מטא, שרצה ישירות על כרטיסי מסך ביתיים עם מעט זיכרון. היא מתאימה למי שחייב מודל מקומי קל משקל להשלמת טקסט באנגלית.

  • 6.7Bפרמטרים
  • 4,096טוקנים בהקשר
  • 3.6 GBמשקל הקבצים
  • 3,212הורדות בחודש

מה זה

מדובר בהמרה ל־4 ביט של מודל הבסיס Llama 2 7B, שביצע TheBloke כדי לאפשר הרצה מקומית בלי לאבד הרבה מהיכולות המקוריות. המודל שוקל סביב 3.9 עד 4.3 גיגה בייט בלבד, מה שמאפשר לטעון את כל 32 השכבות שלו לכרטיס מסך פשוט יחסית. להבדיל מגרסאות ה־Chat, כאן מקבלים מודל גולמי שלא עבר אימון הנחיות או יישור, ולכן הוא מייצר המשך ישיר לטקסט שהזנתם במקום לענות כמו עוזר וירטואלי.

במדדים האקדמיים שפורסמו על מודל המקור, גרסת ה־7B מציגה ציון MMLU של 45.3 ודיוק קוד של 16.8 בלבד במבחן HumanEval ו־MBPP. התוצאות האלה מראות שהוא חלש משמעותית במתמטיקה ובכתיבת קוד לעומת הגרסאות הגדולות יותר של אותה משפחה, אבל מציג בסיס יציב של הבנת הנקרא עם 61.3 וסבירות נמוכה יחסית לרעילות בטקסט.

מתאים ל

  • השלמת טקסט מקומית באנגלית

    משקל הקובץ הנמוך מאפשר להריץ מודל בסיס מלא בזיכרון של כרטיס גרפי שולחני.

  • אימון שכבות LoRA פרטיות

    משמש כבסיס קל וקומפקטי לבדיקות התאמה אישית למשימות ממוקדות בארגון.

  • הטמעה בתשתיות אופליין

    רץ ללא חיבור רשת דרך ExLlama או TGI כשיש מגבלות אבטחה קפדניות.

איפה זה נופל

הכרטיס מדגיש שהשימוש המיועד הוא באנגלית בלבד. המודל אומן על נתונים עם חיתוך בספטמבר 2022, ולכן הוא לא מכיר אירועים עדכניים. במבחני בטיחות ואמינות, ציון ה־TruthfulQA שלו עומד על 33.29 בלבד, מה שאומר שרוב התשובות שלו לשאלות עובדתיות מורכבות עלולות לכלול הזיות ומידע שגוי. הוא אינו מודל שיחה, ואם לא תתנו לו פרומפט ברור להשלמה, הוא פשוט ימשיך לכתוב טקסט רנדומלי מהאינטרנט.

אותה משפחה

Llama-2 יצא ב־17 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם המודל הזה מתאים לעבודה בעברית?

לא. המודל אומן על נתונים באנגלית בלבד, ובכרטיס המודל מוגדר במפורש שכל שפה אחרת היא מחוץ לטווח השימוש. ניסיון לכתוב בעברית יוביל לפלטים שבורים ואיטיים.

האם אפשר לדבר איתו כמו עם בוט צ'אט?

לא באופן ישיר. זהו מודל בסיס שמיועד להשלמת טקסט בלבד ולא עבר אימון שיחה. אם תשאלו אותו שאלה, הוא ינסה להמשיך אותה בתור מסמך במקום לענות לכם כעוזר.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך תומך CUDA עם לפחות 6 גיגה בייט של VRAM עבור משקלי המודל והקשר קצר. מריצים אותו ישירות בקוד פייתון דרך AutoGPTQ, Optimum ו־Transformers, או בממשקים גרפיים כמו text-generation-webui וכלים כמו ExLlama ו־TGI.

בעמוד יש כמה ענפים עם חלוקה שונה לקבוצות גודל. הגרסה בתיקיית 32g תתן דיוק מעט טוב יותר במחיר של שימוש מרבי בזיכרון, בעוד גרסאות ה־128g חוסכות בזיכרון על חשבון ירידה קלה באיכות הפלט. אם המטרה היא מענה לשאלות מורכבות או צ'אט ולא השלמת טקסט מבוקרת, עדיף להשתמש במודל שמכוון להוראות או לפנות ל־API מסחרי.

from transformers import pipeline

pipe = pipeline("text-generation", model="TheBloke/Llama-2-7B-GPTQ")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון ייעודי של מטא המאפשר שימוש מחקרי ומסחרי, בכפוף לתנאי השימוש ומדיניות השימוש המקובל שלהם. הרישיון דורש להסכים לתנאים באתר של מטא לפני הורדת המשקלים, ומוגבל למוצרים עם פחות מ־700 מיליון משתמשים פעילים בחודש במועד ההשקה.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗