GPT
M

NousResearch/Meta-Llama-3.1-8B-Instruct

קוד פתוח

NousResearchllama3.12024-07-24

  • transformers
  • safetensors
  • llama
  • text-generation
  • facebook

גרסה מכווננת שיחות של לאמה 8B מבית מטא שפורסמה מחדש על ידי NousResearch. היא מביאה חלון הקשר עצום של 128 אלף טוקנים לגודל מודל שרץ בקלות על חומרה מקומית.

  • 8Bפרמטרים
  • 131,072טוקנים בהקשר
  • 29.9 GBמשקל הקבצים
  • 307,275הורדות בחודש

מה זה

המאגר הזה מחזיק את משקלי ההוראות של לאמה 3.1 בגודל 8 מיליארד פרמטרים, כפי שפורסמו על ידי NousResearch בספריית transformers. המודל עבר אימון מקדים על יותר מ־15 טריליון טוקנים ולאחר מכן כוונון באמצעות למידת חיזוק ומשוב אנושי, בדגש על שיחות רב־לשוניות וכתיבת קוד.

השדרוג המרכזי מול הדור הקודם בגודל הזה הוא חלון ההקשר, שמגיע ל־128k טוקנים בעזרת מנגנון Grouped-Query Attention. במבחני הביצועים כמו MMLU המודל מציג 66.7 אחוזי דיוק, וב־CommonSenseQA הוא מגיע ל־75 אחוז. המספרים האלה מראים שהוא מחזיק יכולת הבנה והיגיון יציבה מאוד למודל קומפקטי, אך הוא עדיין רחוק מהיכולות של אחיותיו הגדולות בנפח 70B.

מתאים ל

  • צ'אטבוט מבוסס מסמכים

    חלון הקשר של 128k טוקנים מאפשר להזין תיקי מידע שלמים באנגלית ולקבל מענה שיחתי מדויק.

  • סיוע בכתיבת קוד

    המודל אומן על קוד ומייצר פונקציות וסקריפטים במהירות גבוהה על גבי שרת מקומי קטן.

  • ייצור נתונים סינתטיים

    הרישיון מאפשר מפורשות להשתמש בפלטים שלו כדי לבצע זיקוק ולאמן מודלים ייעודיים אחרים.

איפה זה נופל

הנתונים במודל מעודכנים עד דצמבר 2023, כך שהוא לא מכיר אירועים מאוחרים יותר. החיסרון הבולט ביותר לישראלים הוא רשימת השפות הנתמכות, שכוללת רק שמונה שפות כמו אנגלית, ספרדית ותאילנדית, ועברית אינה אחת מהן. המודל אמנם נחשף לשפות נוספות באימון, אבל ללא כוונון ייעודי לעברית התשובות עשויות להיות מקוטעות, שגויות או לא יציבות. בנוסף, משימות חשיבה מורכבות במיוחד ב־MMLU-Pro מניבות 37.1 אחוזים בלבד, תוצאה שמחייבת בדיקה זהירה לפני שמפקידים בידיו לוגיקה עסקית.

שאלות
נפוצות

האם המודל מתאים לעבודה שוטפת בעברית?

עברית אינה מוגדרת כשפה נתמכת בכרטיס המודל. הוא אומן על טקסטים מהרשת ולכן מבין מעט עברית, אך ללא פיין־טיונינג ייעודי הוא יתקשה בדקדוק ועלול להמציא עובדות.

מה היתרון של המשקלים האלה דרך NousResearch לעומת מטא?

המאגר מאפשר הורדה ישירה של המשקלים בתצורת transformers המוכרת מ־Hugging Face ללא צורך באישור גישה מוקדם בטופס של מטא. תוכן המשקלים והארכיטקטורה זהים לגרסת המקור של Llama 3.1 8B Instruct.

איך מריצים

המשקלים שוקלים 29.9 גיגה־בייט ומגיעים בדיוק של bfloat16. כדי לטעון אותו בצורה נקייה בלי קוונטיזציה תצטרכו כרטיס מסך עם לפחות 16 עד 24 גיגה־בייט של זיכרון גרפי, תלוי כמה מההקשר הארוך תנצלו בפועל. ההרצה דורשת transformers בגרסה 4.43.0 ומעלה עם שימוש ב־pipeline הסטנדרטי.

אם אתם מתכוונים לפתוח את כל חלון ההקשר ל־128k טוקנים, תוספת הזיכרון לניהול ה־KV cache תקפיץ את הדרישות מעבר לחומרה ביתית בודדת. במצב כזה, או אם אין ברשותכם שרת ייעודי זמין, קריאה ל־API מנוהל תהיה זולה ופשוטה משמעותית מתחזוקת שרת GPU בענן.

from transformers import pipeline

pipe = pipeline("text-generation", model="NousResearch/Meta-Llama-3.1-8B-Instruct")
print(pipe("שלום"))

הרישיון

השימוש כפוף לרישיון הקהילתי של Llama 3.1 מטעם מטא. הרישיון מתיר שימוש מסחרי ומחקרי, ואף מאפשר להשתמש בפלטים של המודל כדי לאמן מודלים אחרים או לייצר נתונים סינתטיים. יחד עם זאת, חובה לפעול לפי מדיניות השימוש המקובל, והרישיון מגביל שימוש ישיר בשפות שאינן נתמכות ללא התאמה בטוחה מצד המפתח.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗