GPT
M

NousResearch/Meta-Llama-3-8B

קוד פתוח

NousResearchother2024-04-18

  • transformers
  • safetensors
  • llama
  • text-generation
  • facebook

גרסת בסיס גולמית של מטא שהועלתה מחדש על ידי NousResearch. מתאימה למי שרוצה לאמן מודל משלו על ארכיטקטורה חזקה ולא מחפש צ'אטבוט שעונה ישירות מהקופסה.

  • 8Bפרמטרים
  • 8,192טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 56,845הורדות בחודש

מה זה

מדובר במודל הבסיס של מטא עם 8 מיליארד פרמטרים, ולא בגרסת השיחה המיושרת. הוא ראה 15 טריליון טוקנים ומיועד בעיקר להמשך טקסט, כתיבת קוד, או כבסיס לאימון נוסף והתאמה אישית. הארכיטקטורה משתמשת במנגנון Grouped-Query Attention לשיפור מהירות ההסקה, וחלון ההקשר עומד על 8,192 טוקנים.

במבחני ביצועים של מודלים גולמיים, הוא עוקף בקלות את הדור הקודם. במבחן הידע הכללי MMLU הוא קיבל 66.6 מול 53.8 של Llama 2 בגודל 13B, ובמבחן החשיבה BIG-Bench Hard הוא הגיע ל־61.1 לעומת 47.0 של הדגם הגדול יותר מהסדרה הקודמת. המשמעות בפועל היא יכולת חשיבה והבנה כללית טובה בהרבה ממה שהיה מקובל בגדלים האלה, כמעט ברמה של מודלים שהיו כבדים ממנו בהרבה בעבר.

מתאים ל

  • אימון מודל לתחום צר

    משמש נקודת פתיחה מצוינת לכוונון עדין על דאטה פנימי של ארגון, בלי שכבות יישור קודמות שיפריעו.

  • השלמת קוד וטקסט

    מתאים לעבודה שדורשת יצירת המשכים מדויקים לתבניות טקסט קבועות מראש בתוך מערכות פיתוח.

  • מחקר והערכת ביצועים

    מאפשר בדיקה ישירה של יכולות הבסיס של ארכיטקטורת Llama 3 לפני הוספת שכבות alignment.

איפה זה נופל

זהו מודל בסיס, מה שאומר שהוא לא מגיב לשאלות כמו עוזר אישי אלא רק משלים את הטקסט שקיבל. אם תתנו לו שאלה בלי פורמט מתאים, הוא עלול פשוט להמשיך להמציא שאלות דומות. בנוסף, הוא אומן רשמית רק על אנגלית, וכל שימוש בשפות אחרות דורש אימון נוסף מצדכם. תאריך סיום הנתונים שלו הוא מרץ 2023, כך שהוא לא יודע כלום על אירועים מאוחרים יותר, ומטא מציינת בפירוש שאין בו מנגנוני בטיחות מותאמים אישית לשיחה.

אותה משפחה

Meta-Llama-3 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להשתמש בו ישירות לצ'אט עם משתמשים?

לא מומלץ בכלל. המודל הזה לא עבר אימון על הוראות או שיחות, ולכן הוא לא יודע לענות כמו סוכן חכם אלא רק מנחש את המילה הבאה. לצ'אט עדיף להוריד את גרסת ה־Instruct של Llama 3.

הוא עובד טוב בעברית?

הכרטיס מצהיר בפירוש שהמודל מיועד לאנגלית בלבד, וכל שפה אחרת נמצאת מחוץ לטווח השימוש התקין ללא אימון נוסף. הוא אולי יפלוט כמה מילים בעברית פה ושם, אבל אי אפשר לבנות עליו שום מוצר מקומי בלי כוונון ייעודי.

איך מריצים

המשקל של הקבצים מגיע ל־15 גיגה בייט בדיוק bfloat16. להרצה מקומית מלאה צריך כרטיס מסך עם לפחות 16 עד 24 גיגה בייט זיכרון גרפי, כמו RTX 3090 או RTX 4090, רק כדי לטעון אותו ולהשאיר מקום להקשר. אם תרצו לאמן אותו מחדש, תצטרכו כבר חומרה רצינית יותר ברמת מרכז נתונים או שימוש בשיטות כמו LoRA.

מריצים אותו ישירות עם ספריית transformers של פייתון דרך הפונקציה pipeline, או מורידים את המשקולות המקוריות דרך ממשק ה־CLI של Hugging Face לעבודה עם הקוד הרשמי של מטא. אם אתם לא מחזיקים כרטיס גרפי מתאים ולא מתכננים לאמן שכבות חדשות, הרצה דרך שרת ייעודי או ספק ענן תהיה זולה ומהירה בהרבה מהתעסקות מקומית.

from transformers import pipeline

pipe = pipeline("text-generation", model="NousResearch/Meta-Llama-3-8B")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר במאגר כ־other ומפנה לתנאי השימוש המסחריים של מטא ברישיון Llama 3 Community. השימוש מסחרי ומחקרי מותר, אך מותנה בעמידה במדיניות השימוש המקובל שלהם ומחייב התייחסות למגבלות שימוש בשפות שאינן אנגלית ללא התאמה נוספת.

הרישיון המלא בעמוד המודל ↗