GPT
M

Meta-Llama-3.1-8B-Instruct-FP8

קוד פתוח

RedHatAIllama3.12024-07-23

  • transformers
  • safetensors
  • llama
  • text-generation
  • fp8

גרסה מכווצת של מודל שמונה מיליארד פרמטרים ששומרת כמעט על כל הדיוק. היא מיועדת למי שרוצה ביצועים מעולים על חומרה קטנה יותר בחצי.

  • 8Bפרמטרים
  • 131,072טוקנים בהקשר
  • 8.5 GBמשקל הקבצים
  • 118,827הורדות בחודש

מה זה

מדובר במודל שיחה שנוצר באמצעות כיבוץ משקלים ואקטיבציות לפורמט FP8 מתוך מודל הבסיס של מטא. הכיבוץ בוצע באמצעות LLM Compressor על שכבות הטרנספורמר הליניאריות, עם דגימות ממאגר UltraChat. הוא שוקל 8.5 גיגה בייט בלבד, מה שחותך את דרישות הזיכרון בדיסק ובמעבד הגרפי בכחצי ביחס למקור.

במבחני OpenLLM המודל מציג ציון ממוצע של 73.44 לעומת 73.79 במקור הלא מכווץ, כלומר שחזור של 99.52 אחוז מהיכולת. במבחנים כמו MMLU הוא מגיע ל־67.97 לעומת 67.95, ובפתרון בעיות מתמטיות ב־GSM-8K הוא יורד קלות מ־81.96 ל־81.12. בפועל, הירידה בביצועים כמעט לא קיימת ברוב המשימות, ומקבלים תפוקה כמעט זהה למקור בעלות משאבים נמוכה בהרבה.

מתאים ל

  • בוט שיחה באנגלית

    הוא מותאם ישירות לתבנית שיחה ומציג איכות גבוהה באנגלית לצד צריכת זיכרון נמוכה מאוד.

  • ניתוח מסמכים ארוכים

    חלון הקשר של 131 אלף טוקנים מאפשר לקרוא טקסטים כבדים מבלי לחנוק את זיכרון הכרטיס.

  • הסקה חסכונית בשרת בודד

    גודל של 8.5 גיגה מאפשר להריץ כמה מופעים במקביל על כרטיס שרת מודרני אחד דרך vLLM.

איפה זה נופל

הכרטיס מציין במפורש ששימוש בשפות שאינן אנגלית נמצא מחוץ לטווח המיועד, למרות שמטא ציינה תמיכה רשמית בשפות אירופיות, תאילנדית והינדי. עברית בכל מקרה לא מופיעה ברשימה, ולכן לא מומלץ לבנות עליו לטקסטים בעברית בלי בדיקה יסודית של התוצרים. בנוסף, הכיבוץ פגע קלות במבחני היגיון כמו Winogrande ומתמטיקה, כך שאם הדיוק האבסולוטי קריטי לכם, עדיף להישאר בגרסת ה־16 ביט המקורית.

אותה משפחה

Meta-Llama-3.1 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא יעבוד טוב בעברית?

עברית אינה מוגדרת ברשימת השפות הנתמכות, וכרטיס המודל אף מגדיר שימוש בשפות שאינן אנגלית כמחוץ לייעוד. סביר שהוא יבין מילים מסוימות, אבל התחביר והאיכות יהיו ירודים ביחס לאנגלית. למוצר שמיועד לקהל מקומי עדיף לחפש חלופה אחרת.

למה לבחור בגרסה הזו במקום במקורית של מטא?

הגרסה הזו תופסת כחצי מנפח הזיכרון ומאפשרת קצב עיבוד מהיר יותר על מעבדים גרפיים מתאימים. בדיקות הביצועים מראות פגיעה של פחות מחצי אחוז בדיוק הכללי ביחס למקור. אם התשתית שלכם תומכת ב־FP8, מדובר בחיסכון ניכר בעלויות החומרה.

איך מריצים

מריצים אותו בעיקר דרך vLLM שנבנה מקוד מקור, עם תמיכה בהגשה תואמת OpenAI. בזכות הדיוק המכווץ וגודל של 8.5 גיגה בייט, אפשר להריץ אותו בנוחות על כרטיס מסך בודד עם 16 גיגה בייט זיכרון, שתומך בהאצת חומרה ל־FP8.

אם יש לכם כרטיסים ישנים בלי תמיכה טבעית בחישובי שמונה ביט, פענוח המשקלים עלול לייצר צוואר בקבוק, ושם שווה לבדוק אם עדיף להשתמש ב־API חיצוני מוכן.

from transformers import pipeline

pipe = pipeline("text-generation", model="RedHatAI/Meta-Llama-3.1-8B-Instruct-FP8")
print(pipe("שלום"))

הרישיון

השימוש כפוף לרישיון llama3.1 של מטא. הרישיון מאפשר שימוש מסחרי ומחקרי חופשי למרבית החברות, כל עוד מספר המשתמשים הפעילים החודשיים לא עובר 700 מיליון בזמן השחרור. אתם מחויבים לכלול את תנאי הרישיון והודעות זכויות היוצרים בכל הפצה של המודל.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗