GPT
M

Meta-Llama-3.1-8B-Instruct-bnb-4bit

קוד פתוח

unslothllama3.12024-07-23

  • transformers
  • safetensors
  • llama
  • text-generation
  • llama-3

גרסת 4-ביט מכווצת של מודל ההוראות הפופולרי, ששוקלת רק 5.3 גיגה-בייט. היא מאפשרת להריץ או לאמן אותו מקומית על כרטיס מסך בסיסי בלי לוותר על חלון הקשר עצום.

  • 8.2Bפרמטרים
  • 131,072טוקנים בהקשר
  • 5.3 GBמשקל הקבצים
  • 101,240הורדות בחודש

מה זה

מדובר באריזה של מטא שעברה אופטימיזציה על ידי unsloth בעזרת bitsandbytes. המטרה כאן היא לאפשר אימון מהיר פי 2.4 וצריכת זיכרון נמוכה ב־58 אחוזים ביחס לגרסה הרגילה, ישירות דרך מחברת פשוטה או סביבה מקומית.

הבסיס הוא עדיין מודל 8.2 מיליארד פרמטרים שמחזיק ביצועים יפים למשקל שלו. במבחני קוד כמו HumanEval הוא מגיע ל־72.6 אחוז לעומת 60.4 בגרסה הקודמת, וגם ההבנה שלו בקריאות לפונקציות וכלים קפצה משמעותית ל־82.6 אחוז ב־API-Bank. זה מודל שיודע לעבוד עם הנחיות וקוד ברמה מעשית מאוד, כל עוד זוכרים את מגבלות הגודל.

מתאים ל

  • אימון מקומי בתקציב נמוך

    התאמת המודל לנתונים פנימיים על כרטיס T4 יחיד תוך שימוש ב־58 אחוז פחות זיכרון.

  • סוכני שיחה מבוססי כלים

    שילוב בקריאות ל־API וספריות בזכות דיוק של 82.6 אחוז במבחני API-Bank.

  • עיבוד טקסטים ארוכים

    תמיכה בחלון הקשר של 131,072 טוקנים מאפשרת לקרוא מסמכים ארוכים בלי לחתוך מידע.

איפה זה נופל

הנתונים מעודכנים רק עד דצמבר 2023, כך שהוא לא מכיר שום דבר שקרה מאז. בנוסף, מטא מגדירה תמיכה רשמית בשמונה שפות בלבד, ביניהן אנגלית, צרפתית, תאילנדית והינדי. עברית אינה ברשימה, ולמרות שהוא נחשף לטקסטים ברשת, אסור להסתמך עליו למשימות בעברית בלי בדיקה מוקדמת או אימון נוסף. במבחני היגיון מדעי קשים כמו GPQA הוא נעצר ב־30.4 אחוזים, ירידה קלה לעומת הדור הקודם, מה שמראה שבשאלות מורכבות באמת הוא עדיין נוטה לטעות.

אותה משפחה

Meta-Llama-3.1 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית בצורה אמינה?

השפות הרשמיות שנתמכות הן אנגלית, גרמנית, צרפתית, איטלקית, פורטוגזית, הינדי, ספרדית ותאילנדית. הוא נחשף לשפות נוספות ברשת בזמן האימון המקדים, אבל כדי להשתמש בו בעברית במוצר תצטרכו לאמן אותו בעצמכם על נתונים מקומיים.

איזו חומרה נדרשת כדי להריץ ולאמן אותו?

המודל שוקל 5.3 גיגה-בייט בלבד. אפשר להריץ ולאמן אותו על מאיץ מסחרי בסיסי כמו Nvidia T4 עם 16 גיגה-בייט זיכרון גרפי, ואפילו להשתמש בסביבות חינמיות ברשת כמו Google Colab.

איך מריצים

בגלל הכיווץ ל־4-ביט, כל הקבצים מסתכמים ב־5.3 גיגה-בייט. אפשר לטעון ולהריץ אותו ישירות עם ספריית transformers מגירסה 4.43.0 ומעלה, או להשתמש במחברת שמיועדת למאיץ T4 בודד עם 16 גיגה זיכרון.

אם אתם רק צריכים תשובות פשוטות מדי פעם או שאין לכם כרטיס ייעודי זמין, קריאה ל־API חיצוני תחסוך את התחזוקה. הרצה עצמית שווה את המאמץ אם אתם רוצים לאמן אותו על נתונים פרטיים או לייצא לפורמטים כמו GGUF ו־vLLM.

from transformers import pipeline

pipe = pipeline("text-generation", model="unsloth/Meta-Llama-3.1-8B-Instruct-bnb-4bit")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 5.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא רישיון הקהילה של מטא ל־Llama 3.1. הוא מאפשר שימוש מסחרי ומחקרי, כולל יצירת נתונים סינתטיים וזיקוק למודלים אחרים, אבל מחייב עמידה במדיניות השימוש ההוגן ובחוקי יצוא.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗