GPT
L

Llama-3.1-Storm-8B

קוד פתוח

akjindal53244llama3.12024-08-12

  • transformers
  • safetensors
  • llama
  • text-generation
  • llama-3.1

גרסה מכווננת של מודל שמונה מיליארד פרמטרים שמציגה שיפור ניכר בהפעלת פונקציות וציות להוראות. מי שמחפש יכולות סוכן במחשב מקומי בלי לשלם על מודלי ענק ימצא כאן מענה טוב.

  • 8Bפרמטרים
  • 131,072טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 935הורדות בחודש

מה זה

הבסיס כאן הוא המודל הפתוח של מטא באותו הגודל, אבל הצוות שמאחוריו בחר נתיב אימון שונה. הם סיננו מתוך כמעט שלושה מיליון דוגמאות פתוחות רק מיליון דוגמאות איכותיות, הקפיאו מחצית משכבות הרשת בשיטת Spectrum כדי לכוונן רק אזורים מסוימים, ובסוף מיזגו את התוצאה בשיטת SLERP עם המודל Llama-Spark.

במבחנים התוצאה עוקפת את מודל המקור כמעט בכל תחום. השיפור הבולט ביותר הוא בקריאות לפונקציות, עם קפיצה של קרוב לשמונה אחוזים בדיוק הכולל במבחן BFCL ומעל שתים עשרה אחוזים בהבנת תחביר קריאות. יש גם עמידות טובה יותר להזיות עם שיפור של תשעה אחוזים בבדיקת TruthfulQA, ועלייה בפתרון שאלות מורכבות במבחן GPQA. הוא גובר על מתחרים ישירים כמו Hermes-3 ברוב המדדים, אם כי במבחן ההיגיון MuSR המודל של הרמס עדיין מוביל.

מתאים ל

  • סוכנים מבוססי כלים

    מתאים להרצת פונקציות מקומית תודות לשיפור משמעותי במבחן BFCL.

  • עוזר שיחה למחשב מקומי

    רץ ישירות דרך Ollama ומציג ציות גבוה להוראות במשאבים צנועים.

  • שאלות ותשובות מבוססות ידע

    מציג פחות הזיות ומדייק יותר בתשובות עובדתיות ממודל הבסיס של מטא.

איפה זה נופל

היוצרים מצהירים בגלוי שהמודל לא עבר תהליך יישור בטיחות ייעודי משל עצמו. הוא נשען רק על מה שירש ממודל המקור, כך שאין ערובה שהוא יסרב לתכנים בעייתיים או יתנהג בצורה מרוסנת בלי שכבת הגנה חיצונית. בנוסף, אף שהחלון הטכני תומך בטקסטים ארוכים מאוד, זיכרון הכרטיס ייחנק מהר בהקשרים מלאים. עברית אינה מופיעה ברשימת השפות הנתמכות, שכוללת רק שפות אירופיות, הינדי ותאילנדית, לכן פלט בעברית צפוי להיות רעוע ולא מומלץ להסתמך עליו.

אותה משפחה

Llama-3.1-Storm יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לעבודה בעברית?

הוא לא מוגדר כתומך בעברית אלא בשפות כמו אנגלית, גרמנית, צרפתית והינדי. אפשר לשלוח לו טקסט בעברית בגלל הטוקנייזר הרחב, אבל איכות התשובות והדקדוק לא נבדקו וצפויות טעויות רבות.

במה הוא עדיף על Llama 3.1 8B המקורי של מטא?

הוא עבר כוונון ממוקד בשכבות ספציפיות ומיזוג מודלים שהניבו ביצועים טובים יותר בבדיקות מעבדה. השיפור הבולט הוא בהבנת פונקציות ובציות מדויק להנחיות מערכת.

איך מריצים

כדי להריץ את גרסת הדיוק המקורית בפורמט bfloat16 דרוש כרטיס גרפי עם עשרים וארבעה גיגה זיכרון, כמו RTX 3090 או A10G, שמחזיק את חמישה עשר הגיגה של המשקולות לצד זיכרון עבודה לטוקנים. מי שמשתמש במערכות כמו vLLM יכול להרים אותו על כרטיס בודד ולשלוח בקשות דרך פייתון, וקיימת גם גרסת FP8 דינמית שמקלה על עומס הזיכרון.

למי שעובד על מחשב אישי או מעבד בלבד יש מימושי GGUF ותמיכה ישירה בתוכנת Ollama באמצעות פקודת ריצה פשוטה. אם אין לכם חומרה ייעודית זמינה וקצב הקריאות שלכם נמוך, פנייה לשרתי צד שלישי שמארחים מודלי שמונה מיליארד תהיה זולה ופשוטה בהרבה מתחזוקת שרת עצמאי.

from transformers import pipeline

pipe = pipeline("text-generation", model="akjindal53244/Llama-3.1-Storm-8B")
print(pipe("שלום"))

הרישיון

השימוש כפוף לרישיון llama3.1 של מטא. מותר להשתמש בו ליישומים מסחריים ומחקר חופשי, כל עוד אין לכם יותר משבע מאות מיליון משתמשים פעילים בחודש. אם אתם חוצים את הרף הזה, נדרש אישור פרטני ממטא.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗