GPT
M

NousResearch/Meta-Llama-3-8B-Instruct

קוד פתוח

NousResearchother2024-04-18

  • transformers
  • safetensors
  • llama
  • text-generation
  • facebook

גרסת שיחות מכווננת בגודל 8B שרצה בקלות על חומרה מקומית. היא מציגה קפיצת מדרגה אמיתית בביצועים מול דורות קודמים ומתאימה לעוזרים אישיים באנגלית.

  • 8Bפרמטרים
  • 8,192טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 86,751הורדות בחודש

מה זה

מטא אימנה את מודל השיחה הזה על יותר מ־15 טריליון טוקנים, והוא עבר כוונון ייעודי למילוי הוראות ואינטראקציה טבעית באמצעות למידה עם משוב אנושי. היכולות שלו ממוקדות ביצירת טקסט וקוד בלבד, ללא תמיכה במולטימדיה.

במבחני ביצועים כלליים כמו MMLU גרסת הבסיס שלו מגיעה לציון של 66.6, לעומת 45.7 בלבד בגרסת Llama 2 המקבילה, וגם ב־ARC Challenge הוא מזנק ל־78.6 לעומת 53.7. המשמעות המעשית היא פחות הזיות והבנה עמוקה בהרבה של הקשר ומשימות מורכבות, ברמה שעוקפת אפילו את גרסת 13B מהדור הקודם.

מתאים ל

  • עוזרי שיחה באנגלית

    עבר כוונון ייעודי לדיאלוגים ומציג זינוק בביצועי מענה מול הדור הקודם.

  • ייצור והשלמת קוד

    מייצר קוד באופן מובנה ומתאים לשילוב בסביבות עבודה מקומיות.

  • מענה על שאלות מטקסט

    מגיע לתוצאה של 76.4 בבדיקות SQuAD עבור הבנת הנקרא באנגלית.

איפה זה נופל

הכרטיס מגדיר שימוש בשפות שאינן אנגלית במפורש כפעילות מחוץ לתחום היכולות של המודל. עבור משתמשים ישראלים זה אומר ששיחות בעברית יפיקו תוצאות פחות אמינות ללא כוונון נוסף. בנוסף, תאריך העדכון של הידע נעצר במרץ 2023, כך שהוא לא יודע דבר על אירועים מאוחרים יותר.

אותה משפחה

Meta-Llama-3 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לפיתוח בוטים בעברית?

לא באופן טבעי. המפתחים הגדירו במפורש שימוש בשפות שאינן אנגלית כמחוץ לטווח השימוש של המודל. כדי לקבל עברית ברמה טובה תצטרכו לבצע אימון והתאמה ייעודיים.

האם המודל מעודכן למידע מהזמן האחרון?

לא. הידע שהוטמע במודל במהלך האימון נעצר במרץ 2023. לכל שאלה על אירועים שהתרחשו לאחר מכן הוא יזדקק לחיבור למקורות מידע חיצוניים.

איך מריצים

כדי להריץ אותו ישירות דרך transformers בדיוק המקורי של bfloat16 תצטרכו כרטיס מסך עם לפחות 16GB זיכרון VRAM, שכן המשקלים עצמם שוקלים 15.0 GB. השימוש בארכיטקטורת Grouped-Query Attention עוזר לייעל את פעולת הזיכרון בעת יצירת התשובות.

אם אין לכם כרטיס ייעודי כמו RTX 3090 או 4090, עדיף להשתמש ב־API ענן מוכן או לכמת את המודל לפורמטים רזים יותר. בנוסף, חבילת הקבצים הזו דורשת הגדרת טוקני סיום שיחה מיוחדים בקוד כדי שהפלט לא יימרח מעבר לנדרש.

from transformers import pipeline

pipe = pipeline("text-generation", model="NousResearch/Meta-Llama-3-8B-Instruct")
print(pipe("שלום"))

הרישיון

הרישיון הרשום בעמוד הוא other, ומפנה לרישיון הקהילתי של מטא עבור Llama 3. הוא מתיר שימוש מסחרי ומחקרי באנגלית, אך כפוף למדיניות שימוש מקובל ולמגבלות רישוי ייעודיות שחובה לקרוא לפני הפצה במוצר.

הרישיון המלא בעמוד המודל ↗