GPT
L

unsloth/Llama-3.3-70B-Instruct

קוד פתוח

unslothרישיון לא דווח2024-12-06

  • transformers
  • safetensors
  • llama
  • text-generation
  • llama-3

גרסה זו מספקת ביצועים שמתחרים במודלים ענקיים דרך ארכיטקטורה מכווצת יותר. היא מתאימה למי שחייב חלון הקשר עצום ויכולות קוד חזקות על תשתית שרתים ייעודית.

  • 131,072טוקנים בהקשר
  • 131 GBמשקל הקבצים
  • 23,999הורדות בחודש
  • 50לייקים

מה זה

מטא אימנה את הדגם הזה על יותר מ־15 טריליון טוקנים, כשהדגש המרכזי כאן הוא שילוב של 80 שכבות עם מנגנון Grouped-Query Attention וחלון הקשר של 131,072 טוקנים. במבחני קוד ומתמטיקה הוא עוקף את הדור הקודם בפער ניכר, עם 88.4 אחוזים ב־HumanEval וציון 77 ב־MATH, תוצאות שגוברות אפילו על גרסת ה־405B הישנה.

מעבר למספרים היבשים, הדגם עבר כוונון הוראות עם מעל 25 מיליון דוגמאות סינתטיות ומשוב אנושי. היכולת שלו לעקוב אחרי פורמטים והוראות מורכבות קיבלה ציון של 92.1 במבחן IFEval, מה שהופך אותו לבחירה טובה מאוד עבור הרצת כלים, קריאות לפונקציות ועיבוד מסמכים כבדים בלי לאבד את ההקשר.

מתאים ל

  • ניתוח מסמכים ארוכים

    חלון של 128 אלף טוקנים מאפשר להזין קבצים טכניים מלאים או חוזים ולקבל ניתוח עקבי בלי לפצל קטעים.

  • יצירת דאטה סינתטי

    הרישיון של מטא מתיר שימוש בפלטי המודל לצורך אימון וזיקוק מודלים קטנים יותר בארגון.

  • פיתוח סוכני קוד ואוטומציה

    דיוק של 88.4 אחוז ב־HumanEval ותמיכה מובנית בטמפלטים של פונקציות מתאימים לכתיבת סקריפטים.

איפה זה נופל

הנתונים של המודל נעצרים בדצמבר 2023, כך שהוא לא מודע לשום אירוע שהתרחש מאז. בנוסף, רשימת השפות הנתמכות רשמית כוללת שמונה שפות בלבד: אנגלית, גרמנית, צרפתית, איטלקית, פורטוגזית, הינדי, ספרדית ותאילנדית. עברית אינה ברשימה הזו. מטא מזהירה במפורש מפני שימוש בשפות לא נתמכות בלי בדיקות בטיחות ואימון ייעודי, ומבחני שימוש בכלים הראו ציון של 77.3 ב־BFCL v2, ירידה קלה לעומת הדור הקודם שמחייבת ולידציה קפדנית של פלטים בייצור.

אותה משפחה

Llama-3.3 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית בצורה רשמית?

לא. מטא הגדירה שמונה שפות נתמכות בלבד, ועברית אינה אחת מהן. המודל מסוגל לייצר טקסט בעברית על בסיס המידע הכללי ברשת, אך הביצועים והבטיחות שלו בשפה זו אינם מובטחים ללא אימון נוסף.

כמה זיכרון וידאו נחוץ כדי להריץ אותו?

בדיוק המקורי של 16 ביט נדרשים מעל 140 גיגה בייט של זיכרון תצוגה כדי לטעון את המודל ולנהל הקשר רחב. שימוש בגרסאות מכווצות ל־4 ביט דרך ספריות כמו bitsandbytes מאפשר להריץ אותו על פחות מ־48 גיגה בייט זיכרון.

איך מריצים

כדי להעלות את 131 הג'יגה בייט של המשקולות בדיוק bfloat16 מלא, תצטרכו שרת עם לפחות שני כרטיסי H100 או מערך של ארבעה כרטיסי A100 עם 80 גיגה זיכרון. מי שמריץ מקומית בלי חומרה ארגונית כזו יכול להשתמש בקוונטיזציה של 8 ביט או 4 ביט דרך bitsandbytes כדי לחתוך את צריכת הזיכרון בעשרות אחוזים.

אם אין לכם קלאסטר זמין, להחזיק שרת כזה פעיל מסביב לשעון בשביל כמה עשרות פניות ביום זה בזבוז תקציב ברור. במקרה של עומס עבודה לא רציף, קריאה לספק ענן מנוהל תעלה פחות ותחסוך את כאב הראש של תחזוקת התשתית.

from transformers import pipeline

pipe = pipeline("text-generation", model="unsloth/Llama-3.3-70B-Instruct")
print(pipe("שלום"))

הרישיון

בעמוד המודל הנוכחי מצוין כי לא דווח רישיון, אך בטקסט עצמו יש הפניה לרישיון הקהילתי של לאמה 3.3. אי ההתאמה הזו דורשת זהירות, שכן ללא שדה רישיון מוגדר במפורש בהגדרות הקובץ, המחלקה המשפטית שלכם עלולה לחסום את השימוש בו. כדאי לבדוק את תנאי ההסכם המקוריים של מטא לפני הפצה במוצר.

הרישיון המלא בעמוד המודל ↗