GPT
L

Llama-3.1-SuperNova-Lite

קוד פתוח

arcee-aillama32024-09-10

  • transformers
  • safetensors
  • llama
  • text-generation
  • conversational

גרסת 8B שעברה זיכוך ישירות מתוך המודל הענק של 405B. מקבלים יכולת דיוק גבוהה בהבנת הוראות בלי להחזיק שרת כבד ומסורבל.

  • 8Bפרמטרים
  • 131,072טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 1,068הורדות בחודש

מה זה

מדובר במודל שמבוסס על Llama-3.1-8B-Instruct, אבל במקום אימון רגיל, Arcee.ai זיככו לתוכו ידע ישירות מגרסת ה־405B באמצעות לוגיטים שחולצו ממנה. התהליך הזה נשען גם על דאטה-סט שנוצר עם כלי בשם EvolKit, במטרה לתת ביצועים שמזכירים מודלי ענק בגוף קל בהרבה.

במבחנים הפומביים רואים בדיוק איפה הזיכוך הזה עובד ואיפה הפיזיקה של מודל קטן עדיין מגבילה אותו. בבדיקת הבנת הוראות, IFEval, הוא מגיע לציון מרשים של 80.17, כלומר הוא מקשיב טוב מאוד להנחיות הפורמט שנותנים לו. מצד שני, במבחני חשיבה כבדים כמו MMLU-PRO הוא עומד על 31.97, ובמבחן MATH ברמה 5 הוא מוציא 15.48 בלבד.

מתאים ל

  • עבודה צמודה להנחיות

    עם ציון של 80.17 ב־IFEval, הוא מעולה להפקת פלטים בפורמט קשיח או לפי כללים מוגדרים היטב.

  • עיבוד טקסטים באנגלית

    ניתוח וסיכום של מסמכים ארוכים באנגלית בתוך מסגרת של עד 131,072 טוקנים.

  • סוכן שיחה יעיל מקומית

    מתאים לשימוש עצמאי על חומרה מקומית כשצריך זמני תגובה מהירים בלי לשלם על מודלי ענק.

איפה זה נופל

הנתונים מראים נפילה ברורה ברגע שהמשימה דורשת ידע מדעי עמוק או פתרון בעיות מתמטיות. ציון של 7.49 בלבד במבחן GPQA ו־11.67 ב־MuSR מבהיר שלא כדאי לסמוך עליו במחקר מורכב, בניתוח לוגי רב-שלבי או בחישובים. בנוסף, המודל אומן והוגדר עבור השפה האנגלית בלבד, כך שלא הייתי בונה עליו לפרויקטים בעברית בלי בדיקה מקיפה מראש.

שאלות
נפוצות

האם המודל עובד טוב בעברית?

הכרטיס מצהיר על תמיכה באנגלית בלבד. מודלים ממשפחת Llama 3 מסוגלים לפעמים לקלוט עברית בסיסית, אבל כאן האימון והזיכוך לא כוונו לשם, ולא מומלץ להסתמך עליו למשימות בעברית.

מה המשמעות של מודל מזוכך מגרסת 405B?

החוקרים של Arcee.ai לקחו את ההסתברויות והתשובות של מודל הענק כדי ללמד את מודל ה־8B לחקות אותו. התוצאה היא מעקב טוב בהרבה אחרי הוראות, אם כי כוח החישוב הבסיסי נשאר מוגבל לגודל של 8B.

איך מריצים

המשקל הכולל של הקבצים עומד על 15.0 גיגה-בייט בפורמט bfloat16 עם ארכיטקטורת transformers רגילה. כדי להריץ אותו בלי שום קוונטיזציה תצטרכו כרטיס מסך עם מספיק זיכרון וידאו להחזיק את כל המשקולות פלוס מקום סביר לחלון ההקשר, שתומך תיאורטית בעד 131,072 טוקנים.

אם אין לכם כרטיס חזק מקומי עם מספיק VRAM פנוי, או אם אתם מתכננים לנצל את מלוא חלון ההקשר הארוך שמנפח את הזיכרון במהירות, עדיף להרים אותו על שרת ייעודי בענן או לצרוך מודל דרך API.

from transformers import pipeline

pipe = pipeline("text-generation", model="arcee-ai/Llama-3.1-SuperNova-Lite")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון llama3 של חברת מטא. הוא מאפשר שימוש מסחרי חופשי כל עוד אתם עומדים בתנאי השימוש המקוריים של Llama 3, שכוללים מגבלת משתמשים חודשיים גדולה מאוד ומחייבים לשמור על תנאי השימוש המקובלים של המודל.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗