GPT
M

Meta-Llama-3.1-70B-Instruct-FP8

קוד פתוח

RedHatAIllama3.12024-07-23

  • transformers
  • safetensors
  • llama
  • text-generation
  • fp8

גרסת שמונה ביט שמכווצת את ענק הקוד הפתוח בחצי מנפח הזיכרון בלי לאבד ביצועים כמעט בכלל. מתאים למי שרוצה להריץ מודל של 70 מיליארד פרמטרים על שני כרטיסי מסך חזקים במקום ארבעה.

  • 71Bפרמטרים
  • 131,072טוקנים בהקשר
  • 67.7 GBמשקל הקבצים
  • 141,787הורדות בחודש

מה זה

מדובר בגרסה מכווצת של מודל השיחה הגדול של מטא, שעברה קוונטיזציה של משקולות ואקטיבציות לפורמט FP8 באמצעות LLM Compressor. הכיווץ מוריד את גודל הקבצים ואת צריכת זיכרון ה־GPU בכחמישים אחוזים, כך שכל המשקולות תופסות 67.7 גיגה בייט בדיסק במקום מעל 130 גיגה בייט בגרסת המקור.

היתרון הגדול כאן הוא המדדים בפועל. במבחן OpenLLM הוא מוציא ציון ממוצע של 84.29 לעומת 84.40 במקור המלא, שזה שימור של 99.88 אחוזים מהיכולת. במתמטיקה עם GSM-8K הוא יורד רק מ־94.92 ל־94.54, ובמבחני היגיון כמו Winogrande הוא אפילו עלה טיפה ל־85.95. זה אומר שאתם מקבלים כמעט במדויק את אותה רמת הסקה של מודל הדגל, אבל בחצי מדרישות החומרה.

מתאים ל

  • עוזר שיחה ארגוני פנימי

    מציע רמת דיוק גבוהה באנגלית ומאפשר מענה על מסמכים ארוכים בתוך תשתית מאובטחת.

  • פתרון בעיות מתמטיקה וקוד

    שומר על ציון של 94.54 במבחן GSM-8K, מה שמבטיח יכולת הסקה אנליטית חזקה.

  • שרת שירות חסכוני

    מאפשר הגשת מודל של 70B בעומס סביר על גבי שני כרטיסי מסך בלבד באמצעות vLLM.

איפה זה נופל

היוצרים מצהירים במפורש בכרטיס ששימוש בשפות שאינן אנגלית נמצא מחוץ לטווח המיועד של המודל. למרות שהמקור תומך בעוד כמה שפות כמו גרמנית או ספרדית, עברית בכלל לא רשומה במפרט, והתנהגות המודל בעברית תהיה לא יציבה או מוגבלת מאוד. מעבר לזה, הכיווץ בוצע באמצעות כיול על 512 דוגמאות ממאגר UltraChat בלבד, כך שמשימות מורכבות מאוד שחורגות מפורמט של שיחה רגילה עלולות להציג ירידה שלא נתפסה במבחנים הרשמיים.

אותה משפחה

Meta-Llama-3.1 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה מתאים לעבודה בעברית?

לא מומלץ לבנות עליו למוצר בעברית. כרטיס המודל מגדיר כל שפה שאינה אנגלית כמחוץ לטווח השימוש המיועד, ועברית אפילו לא נכללת ברשימת השפות הנתמכות בבסיס שלו. אם אתם חייבים עברית טובה, תצטרכו לבדוק מודלים אחרים או להסתמך על מודלים מסחריים גדולים.

כמה כוח מחשוב צריך כדי להרים אותו?

המשקולות לבדן שוקלות קרוב ל־68 גיגה בייט. כדי להריץ אותו דרך vLLM עם חלון הקשר סביר תצטרכו לפחות שני כרטיסי מסך מודרניים עם תמיכה ב־FP8 ומינימום של 48 גיגה בייט זיכרון בכל כרטיס.

איך מריצים

כדי להריץ אותו צריך מנוע שתומך ב־FP8 כמו vLLM. הקוד בכרטיס מגדיר חלוקה לשני כרטיסי מסך, כך שתצטרכו שני כרטיסים של לפחות 48 או 80 גיגה בייט זיכרון כדי להחזיק את 68 הגיגה בייט של המשקולות ועוד מקום ל־KV Cache ולהקשר הארוך של 131,072 טוקנים.

אם אין לכם שני מעבדים גרפיים ייעודיים בשרת, המודל הזה פשוט יקרוס מחוסר זיכרון. במקרה כזה, עדיף בהרבה להשתמש ב־API מוכן של ספק ענן חיצוני שמתמחר לפי שימוש, במקום להשכיר שרת יקר לחודש מלא.

from transformers import pipeline

pipe = pipeline("text-generation", model="RedHatAI/Meta-Llama-3.1-70B-Instruct-FP8")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון llama3.1 של מטא. הוא מאפשר שימוש מסחרי ומחקרי חופשי לחלוטין לרוב החברות, כל עוד מספר המשתמשים החודשיים שלכם לא חוצה את רף 700 המיליון ולא הפרתם חוקי סחר או את מדיניות השימוש המקובלת.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗