GPT
M

Meta-Llama-3.1-8B-Instruct-AWQ-INT4

קוד פתוח

hugging-quantsllama3.12024-07-19

  • transformers
  • safetensors
  • llama
  • text-generation
  • llama-3.1

גרסה מכווצת של המודל הפתוח של מטא, שדוחסת 8 מיליארד פרמטרים לרמת זיכרון מינימלית. היא מיועדת למי שרוצה ביצועי שיחה חזקים על כרטיס מסך ביתי בלי לשלם על שרתים יקרים.

  • 8Bפרמטרים
  • 131,072טוקנים בהקשר
  • 5.3 GBמשקל הקבצים
  • 307,559הורדות בחודש

מה זה

מדובר בגרסת קוונטיזציה של מודל ההוראות Llama 3.1 8B, שבוצעה באמצעות AutoAWQ בשיטת INT4 עם group size של 128. במקום לתפוס סביב 16 גיגה זיכרון בפורמט המקורי, כל המשקלים יושבים בקבצים של כחמישה גיגה בלבד, מה שמאפשר להריץ אותו ישירות מקומית על כרטיסי מסך צנועים בהרבה.

הבסיס של מטא מאומן מראש לשיחה ומיושר לפקודות, כולל תמיכה מובנית בשפות כמו אנגלית, ספרדית, גרמנית, צרפתית, איטלקית, פורטוגזית, הינדי ותאי. הכיווץ הזה שומר על דיוק גבוה יחסית למקור תוך הפחתה דרסטית בעומס החישובי, מה שהופך אותו לבחירה מעשית למשימות טקסט שדורשות תגובה מהירה בלי לשרוף משאבים.

מתאים ל

  • עוזר שיחה מקומי

    צורך מעט זיכרון וידאו ומאפשר להריץ בוט תגובתי ישירות על מחשב פיתוח עם כרטיס גרפי יחיד.

  • שרת שאלות ותשובות בארגון

    מתאים לפריסה בקונטיינר vLLM פנימי כדי לשמור על פרטיות המידע בלי להוציא פניות לשירותי צד שלישי.

  • עיבוד טקסט בשפות אירופיות

    מאומן רשמית למספר שפות כמו אנגלית וספרדית, ומפיק תשובות עקביות במשימות הוראה וסיכום.

איפה זה נופל

הכרטיס מדגיש שארבעה גיגה של זיכרון וידאו מספיקים רק למודל עצמו, בלי חישובי ההקשר והמטמון. אם תנסו לנצל את כל 131,072 הטוקנים של חלון ההקשר, צריכת הזיכרון תקפוץ בצורה חדה ותקרוס על כרטיסים קטנים. בנוסף, עברית אינה מופיעה ברשימת השפות הנתמכות רשמית של המודל, כך שחובה לבדוק איכות פלט והבנה מקומית לפני שסומכים עליו למשימות בעברית.

אותה משפחה

Meta-Llama-3.1 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה על כרטיס מסך עם 6GB של זיכרון?

זה גבולי מאוד. המודל עצמו תופס קצת מעל 4GB רק בטעינה ראשונית. עם טוקנים בודדים זה עשוי לעבוד, אבל בהקשרים ארוכים הזיכרון ייגמר מיד.

איך הכי מומלץ להריץ אותו בסביבת ייצור?

הדרך היעילה ביותר היא להשתמש ב־vLLM או TGI דרך דוקר. הכלים האלה מנצלים קרנלים מותאמים ל־AWQ ומספקים ממשק תואם OpenAI עם ביצועים טובים בהרבה מהרצה רגילה בפייתון.

האם המודל תומך בעברית באופן מלא?

עברית לא מופיעה ברשימת השפות הרשמית של מטא עבור המודל. הוא מסוגל לקלוט מילים בעברית בזכות נתוני האימון הכלליים, אבל עלול לייצר שגיאות תחביר או תרגום, ולכן צריך לבדוק אותו היטב לפני שימוש.

איך מריצים

בשביל לטעון את המשקלים עצמם נדרשים קצת יותר מארבעה גיגה של זיכרון וידאו, אבל בפועל צריך כרטיס עם שמונה עד שנים עשר גיגה כדי להשאיר מקום לטעינת הזיכרון של השיחה ופעולות ההסקה. אפשר להרים אותו ישירות דרך פייתון עם ספריית AutoAWQ או transformers, אבל בייצור עדיף להריץ אותו בתוך קונטיינר של vLLM או TGI שכולל תמיכה בקרנלים של Marlin למהירות גבוהה יותר.

אם אין לכם כרטיס מסך ייעודי של אנבידיה עם מספיק זיכרון, או שאתם לא רוצים לנהל מכונות בענן, עדיף להשתמש בנקודת קצה מנוהלת דרך ספק צד שלישי במקום לנסות לדחוף אותו למעבד רגיל שבו הוא יעבוד לאט מאוד.

from transformers import pipeline

pipe = pipeline("text-generation", model="hugging-quants/Meta-Llama-3.1-8B-Instruct-AWQ-INT4")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון llama3.1 של מטא. הוא מאפשר שימוש מסחרי ומחקר, אבל מחייב שמירה על תנאי המדיניות שלהם והפצה תחת אותו רישיון עבור פיתוחים נגזרים.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗