GPT
L

NousResearch/Llama-2-7b-chat-hf

קוד פתוח

NousResearchרישיון לא דווח2023-07-18

  • transformers
  • pytorch
  • safetensors
  • llama
  • text-generation

גרסה מומרת לפורמט transformers של מודל השיחה מבית מטא. מתאים למי שרוצה להריץ שרת שיחה בסיסי באנגלית מקומית ובאופן ישיר בלי תלות באישורי גישה ידניים.

  • 6.7Bפרמטרים
  • 4,096טוקנים בהקשר
  • 37.7 GBמשקל הקבצים
  • 41,305הורדות בחודש

מה זה

מדובר בגרסת שבעה מיליארד הפרמטרים של Llama 2 שעברה אימון ייעודי לשיחה עם פידבק אנושי, והוסבה למבנה המקובל של ספריית transformers על ידי קבוצת NousResearch. הוא אומן על שני טריליון טוקנים ומיועד לשיחה ישירה דרך טקסט באנגלית בלבד.

במדדים האקדמיים הוא עומד על 45.3 בבחינת MMLU וציון של 16.8 בלבד בכתיבת קוד. בבדיקות בטיחות כמו ToxiGen גרסת השיחה מציגה אפס אחוזי רעילות במבחן, וציון של 57.04 במבחן האמינות TruthfulQA, מה שמציב אותו בעמדה סבירה להבנת טקסט יומיומי אבל חלש משמעותית בכל מה שקשור ללוגיקה וחישוב.

מתאים ל

  • בוט שיחה פנימי באנגלית

    מענה לשאלות משתמשים באנגלית על בסיס טקסט מוכן, בזכות אימון ייעודי להתנהגות כעוזר אישי.

  • סיכום טקסטים קצרים

    עיבוד והבנת הנקרא באנגלית על מסמכים שנכנסים בתוך חלון של 4,096 טוקנים.

  • מיון טקסטים וסיווג

    חלוקת פניות לקוחות לקטגוריות כלליות בלי צורך ביכולות חישוב מתמטיות או יצירת קוד.

איפה זה נופל

הכרטיס מגדיר מפורשות שימוש באנגלית בלבד. כל ניסיון לעבוד איתו בעברית יוצא מחוץ להגדרות השימוש ויוביל לתוצאות ירודות עקב היעדר אימון ייעודי בשפה.

נוסף על כך, המודל מציג חולשה קיצונית במשימות טכניות. עם ציון 14.6 בלבד במתמטיקה ופחות מ־17 אחוז במבחני כתיבת קוד, הוא יתקשה מאוד במשימות לוגיות מורכבות. המידע עליו הוא אומן נעצר בספטמבר 2022 עם מעט עדכונים מיולי 2023, ולכן הוא מייצר הזיות מוחלטות על אירועים מאוחרים יותר.

אותה משפחה

Llama-2 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. הכרטיס מציין במפורש שהמודל אומן ונבדק באנגלית בלבד, ושימוש בשפות אחרות מוגדר מחוץ לתחום השימוש המיועד. תגובות בעברית יהיו איטיות, משובשות ומלאות שגיאות תחביר.

האם המודל מתאים לייצור קוד?

הוא חלש מאוד בתחום הזה. המבחנים בכרטיס מראים ציון של 16.8 בלבד בבדיקות כתיבת תוכנה, כך שלא כדאי להסתמך עליו כעוזר פיתוח.

למה המשקל של הקבצים גדול בהרבה מהצפוי למודל של 7B?

ההפצה הזו כוללת 18 קבצים במשקל כולל של 37.7 גיגה בייט בדיוק מלא של float16. כדי לפרוס אותו ביעילות, תצטרכו להמיר את המשקלים או לבצע קוונטיזציה כדי לחסוך מקום בשרת.

איך מריצים

כדי להריץ אותו כמו שהוא בדיוק float16 תצטרכו לפחות 16 גיגה בייט זיכרון בכרטיס מסך רק כדי לטעון את המשקלים, בלי לחשב את זיכרון ההקשר לשיחה עצמה. המשקל הכולל של הקבצים מגיע ל־37.7 גיגה בייט ומחולק ל־18 קבצים שונים, כך שההורדה הראשונית כבדה.

המודל דורש תבנית פרומפט נוקשה מאוד שכוללת תגיות כמו INST ופקודות מערכת מסוג SYS, ורווחים לא נכונים שם ישברו לו את הדיוק. אם המטרה שלכם היא לבדוק מהר אם הרעיון שלכם עובד, עדיף להשתמש ב־API מנוהל ולחסוך את הקצאת החומרה היקרה הזו בשלב הפיתוח הראשוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="NousResearch/Llama-2-7b-chat-hf")
print(pipe("שלום"))

הרישיון

בעמוד המודל עצמו לא דווח רישיון ישיר, אך בטקסט הנלווה מצוין כי השימוש כפוף לרישיון המסחרי המקורי של חברת מטא. הרישיון הזה מתיר שימוש מסחרי ומחקרי באנגלית תחת תנאי שימוש נוקשים ומדיניות שימוש מקובלת, אך היעדר הגדרת רישיון רשמית בקובצי ההפצה של NousResearch עלול ליצור עמימות משפטית לפרויקטים מסחריים.

הרישיון המלא בעמוד המודל ↗