GPT
M

Meta-Llama-3-70B

קוד פתוח

meta-llamallama32024-04-17

  • transformers
  • safetensors
  • llama
  • text-generation
  • facebook

גרסת הבסיס החזקה ביותר של מטא בגודל 70 מיליארד פרמטרים. היא מיועדת למי שרוצה בסיס לאימון והתאמה אישית, ולא צ'אטבוט שמגיב ישר מהקופסה.

  • 71Bפרמטרים
  • 8,192טוקנים בהקשר
  • 263 GBמשקל הקבצים
  • 112,956הורדות בחודש

מה זה

זהו מודל שפה גולמי שאומן על יותר מ־15 טריליון טוקנים ממקורות מקוונים פתוחים, עם תאריך עדכון של דצמבר 2023. הוא מפיק טקסט וקוד באנגלית ומציג קפיצה חדה ביחס לדור הקודם, כמו ציון של 79.5 ב־MMLU לעומת 69.7 ב־Llama 2 המקביל. השימוש ב־Grouped-Query Attention מסייע ליעילות בעיבוד, אך הארכיטקטורה מותאמת לייצור המשכי של טקסט ולא לשיחה חופשית.

מכיוון שמדובר במודל בסיס ולא בגרסת Instruct, הוא אינו מכיל אימון על הוראות (SFT) או יישור מול העדפות אנושיות (RLHF). הוא פשוט ממשיך את הטקסט שאתם מזינים לו, מה שהופך אותו לבחירה טבעית לחברות שרוצות לאמן מודל פנימי על נתונים פרטיים מאפס ולא להילחם בסגנון שיחה שנקבע מראש.

מתאים ל

  • בסיס לכוונון עדין

    אימון על מאגרי מידע ארגוניים באנגלית ליצירת מודל מומחה שמכיר את התחום שלכם.

  • השלמת קוד וטקסט

    הפקת המשך ישיר למסמכים טכניים או קטעי קוד בזכות ביצועים גבוהים במבחני ידע.

  • יצירת דאטה סינתטי

    ייצור דוגמאות אימון למודלים קטנים יותר מתוך ידע רחב שנצבר על 15 טריליון טוקנים.

איפה זה נופל

הבעיה המרכזית שלו היא השפה. מטא מגדירה שימוש בכל שפה שאינה אנגלית כמחוץ לתחום המיועד, כך שעבור עברית הוא ידרוש מכם אימון והתאמה משמעותיים. בנוסף, חלון ההקשר עומד על 8,192 טוקנים בלבד, מה שמגביל מאוד ניתוח של מסמכים ארוכים. המודל גם אינו כולל שכבות בטיחות מובנות של שיחה, והוא עלול לייצר פלטים לא רצויים או חזרות אם הפרומפט לא הונדס במדויק.

אותה משפחה

Meta-Llama-3 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להשתמש במודל הזה עבור בוט שירות לקוחות בעברית?

ממש לא. המודל מוגדר רשמית לשימוש באנגלית בלבד, ואינו כולל התאמה לשיחה (Instruct). כדי שיעבוד בעברית וישוחח כראוי, תצטרכו להשקיע מאמץ כבד באימון והתאמה.

מה ההבדל בין המודל הזה לגרסת ה־Instruct של אותו גודל?

המודל הזה הוא מודל בסיס שרק מנחש את המילה הבאה, בעוד גרסת ה־Instruct עברה כוונון מיוחד להבנת פקודות ושיחה. אם המטרה היא לקבל תשובות לשאלות, גרסת ה־Instruct מתאימה בהרבה.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־263 גיגה-בייט בפורמט bfloat16, מה שאומר שאי אפשר להריץ אותו על שרת פשוט. תצטרכו מערך של מספר כרטיסי GPU חזקים עם זיכרון וידאו גדול מאוד, בדומה לתצורות של כרטיסי A100 או H100, כדי לטעון אותו ולהריץ הסקת מסקנות בקצב סביר דרך transformers או TGI.

אם כל מה שאתם צריכים זה להריץ ניסוי קצר, לבדוק פרומפטים או לבנות פיצ'ר מהיר, החזקת תשתית כזו בעצמכם תעלה אלפי דולרים בחודש. במקרים כאלה עדיף לגשת למודל דרך ספקי API חיצוניים, ולהרים שרתים ייעודיים רק כשאתם מתכוונים לאמן אותו על דאטה משלכם או מחויבים לפרטיות מוחלטת של המידע.

from transformers import pipeline

pipe = pipeline("text-generation", model="meta-llama/Meta-Llama-3-70B")
print(pipe("שלום"))

הקבצים

50 קבצים במאגר, 263 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא רישיון Llama 3 קהילתי ומסחרי מטעם מטא. מותר להשתמש בו במוצרים מסחריים ובמחקר, אך השימוש מוגבל לאנגלית בלבד אלא אם מאמנים אותו במיוחד. עליכם לציית למדיניות השימוש המקובל של מטא ולתנאי הרישיון המלאים שמפורסמים באתר שלהם.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗