GPT
M

Meta-Llama-3.1-8B-bnb-4bit

קוד פתוח

unslothllama3.12024-07-23

  • transformers
  • safetensors
  • llama
  • text-generation
  • llama-3

גרסה מכווצת בארבעה ביטים למודל של מטא, שמיועדת לחסוך בזיכרון ולהקל על אימון מקומי. מי שבוחר בה מחפש חלון הקשר ענק בחומרה צנועה.

  • 8.2Bפרמטרים
  • 131,072טוקנים בהקשר
  • 5.3 GBמשקל הקבצים
  • 15,027הורדות בחודש

מה זה

המודל מבוסס על Llama 3.1 בגודל 8.2 מיליארד פרמטרים, כשהוא מגיע בכימות של bitsandbytes כדי לצמצם את תפיסת הזיכרון. לפי הנתונים של אנזלות', שימוש בספרייה שלהם חוסך 58 אחוז בצריכת הזיכרון ומאיץ את האימון פי 2.4 ביחס לריצה רגילה. השיפור המרכזי מול הדור הקודם מתבטא בזינוק במשימות קוד ושימוש בכלים, למשל עליה מ־60.4 ל־72.6 ב־HumanEval וציון 82.6 ב־API-Bank לעומת 48.3.

היתרון הגדול הנוסף הוא חלון הקשר של 128 אלף טוקנים, שמתאים לטיפול בטקסטים ארוכים במיוחד. עם זאת, צריך לזכור שכימות ל־4 ביט גובה מחיר מסוים בדיוק הכללי של המודל ביחס למשקלים המקוריים ב־bfloat16.

מתאים ל

  • אימון על כרטיס מסך בודד

    צריכת הזיכרון הנמוכה מאפשרת לבצע fine-tuning מלא או LoRA על חומרה זולה כמו כרטיס T4.

  • הפעלת כלים ו־APIs

    קפיצה ל־82.6 בבנצ'מרק API-Bank מאפשרת לחבר אותו לסוכנים שקוראים לפונקציות בקוד.

  • ניתוח מסמכים באנגלית

    חלון הקשר של 128 אלף טוקנים מתאים לעיבוד טקסטים ארוכים במיוחד על שרת צנוע.

איפה זה נופל

הכרטיס הרשמי מציין תמיכה בשמונה שפות בלבד: אנגלית, גרמנית, צרפתית, איטלקית, פורטוגזית, הינדי, ספרדית ותאילנדית. עברית לא ברשימה הזו. מטא מציינת שהמודל נחשף ליותר שפות אך מזהירה ששימוש מעבר לרשימה דורש אימון נוסף ובדיקה עצמאית, כך שהפלט בעברית לא צפוי לעבוד טוב מהקופסה. בנוסף, נתוני האימון מעודכנים עד דצמבר 2023, והמודל נוטה לסרב לפניות גבוליות בגלל התאמות הבטיחות.

אותה משפחה

Meta-Llama-3.1 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לעבודה בעברית?

הוא לא מוגדר רשמית כתומך בעברית, והחומר מציין רק שמונה שפות נתמכות כמו אנגלית, ספרדית ותאילנדית. הוא אמנם ראה שפות נוספות באימון הראשוני, אבל בלי fine-tuning ייעודי לא הייתי בונה עליו לפרויקט בעברית.

איזה כרטיס מסך צריך כדי להריץ אותו?

בזכות הכימות לארבעה ביטים, קבצי המודל תופסים 5.3 גיגה בייט בלבד. כרטיס עם 16 גיגה זיכרון כמו Tesla T4 יספיק גם לאימון לפי נתוני היצרן, וכרטיסים ביתיים עם 8 או 12 גיגה יספיקו להרצה רגילה.

האם מותר להשתמש בו לאימון מודל קטן יותר?

כן, תנאי הרישיון של Llama 3.1 מאפשרים במפורש שימוש בפלטים של המודל כדי ליצור נתונים סינתטיים ולזקק מודלים אחרים, כל עוד פועלים לפי מדיניות השימוש של מטא.

איך מריצים

בזכות הכימות ל־4 ביט, משקל הקבצים עומד על 5.3 גיגה בייט בלבד. אפשר לטעון ולאמן אותו על כרטיס בסיסי כמו Tesla T4 בענן החינמי של גוגל קולאב, בלי לקרוס מחוסר זיכרון וידאו, מה שאי אפשר לעשות בגרסת ה־bfloat16 המקורית.

אם אתם צריכים רק להוציא פלט מטקסט ארוך בזמן אמת ולא מאמנים מודל בעצמכם, החזקת מאיץ ייעודי לטוקנים בודדים תעלה יותר כסף וזמן פיתוח לעומת פנייה ל־API קיים שמריץ את המודל המלא.

from transformers import pipeline

pipe = pipeline("text-generation", model="unsloth/Meta-Llama-3.1-8B-bnb-4bit")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 5.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא רישיון הקהילה של Llama 3.1. הוא מאפשר שימוש מסחרי ומחקרי, ומתיר באופן מפורש שימוש בפלט של המודל כדי לאמן ולזקק מודלים אחרים. התנאי הוא ציות למדיניות השימוש המקובל של מטא ולמגבלות השימוש שלה.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗