GPT
L

llama-3-8b-Instruct-bnb-4bit

קוד פתוח

unslothllama32024-04-18

  • transformers
  • safetensors
  • llama
  • text-generation
  • llama-3

גרסת 4 ביט מכווצת של מודל ההוראות הפופולרי מבית מטא. היא שוקלת רק 5.3 גיגהבייט ונועדה לרוץ על כרטיסי מסך בסיסיים בלי לאבד חדות בשיחה ובקוד.

  • 8.2Bפרמטרים
  • 8,192טוקנים בהקשר
  • 5.3 GBמשקל הקבצים
  • 60,934הורדות בחודש

מה זה

מטא בנתה את הדור השלישי של מודלי שמונה מיליארד הפרמטרים על גבי 15 טריליון טוקנים, וצוות אנזלות ארז אותו בפורמט bitsandbytes מכווץ. הדגם מגיע עם 32 שכבות וחלון הקשר של 8,192 טוקנים, כשהוא מכוון מראש לעבודה מול פקודות ושיחה חופשית.

במבחני ביצועים מול הדור הקודם, השיפור ניכר במיוחד במשימות חשיבה וכתיבת קוד. במבחן HumanEval הוא מזנק לציון 62.2 מול 7.9 בלבד בגרסה המקבילה של לאמה 2, ובמבחן המתמטיקה GSM-8K הוא מגיע ל־79.6 לעומת 25.7 בעבר. זה אומר שהוא מתמודד עם ניתוח לוגי וכתיבת סקריפטים ברמה שונה לגמרי ממה שהיה מקובל בגדלים האלה.

מתאים ל

  • עוזר שיחה ופקודות באנגלית

    הוא עבר כוונון ייעודי לתשובות בשיחה ומספק מענה מדויק יחסית בלי להעמיס על הזיכרון.

  • מחולל סקריפטים ופונקציות

    עם ציון 62.2 במבחן קוד, הוא מתאים ליצירת קטעי תוכנה קצרים ובדיקות לוגיות פשוטות.

  • מיצוי מידע מטקסט קצר

    הוא מטפל היטב במשימות הבנת הנקרא עד 8,192 טוקנים על גבי חומרה מקומית זולה.

איפה זה נופל

המודל אומן והוגדר לעבודה באנגלית בלבד. כל ניסיון לתחקר אותו בעברית ידרוש אימון נוסף או שיוביל לתשובות שבורות, משום ששפות אחרות מוגדרות מחוץ לטווח השימוש הרשמי שלו. נקודת חיתוך הידע נעצרת במרץ 2023, כך שהוא לא מכיר אירועים וספריות תוכנה מהתקופה האחרונה. בנוסף, במבחני מתמטיקה מורכבים כמו MATH הוא נעצר בציון 30 בלבד.

אותה משפחה

llama-3 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית ישר מהקופסה?

לא. המודל הוגדר ונבדק באנגלית בלבד, ושימוש בשפות אחרות מוגדר במסמכים כחריגה מהייעוד המקורי. כדי לעבוד איתו בעברית בצורה סבירה תצטרכו לאמן אותו מחדש על דאטה מתאים.

האם חייבים כרטיס מסך יקר בשביל להריץ אותו?

ממש לא. הקבצים שוקלים 5.3 גיגהבייט בלבד בזכות דחיסת 4 ביט. כרטיס מסך בסיסי עם 8 גיגהבייט זיכרון או סביבת קולאב חינמית עם T4 יספיקו כדי להעלות אותו.

איך מריצים

בזכות הדחיסה לקבצים במשקל 5.3 גיגהבייט, אפשר לטעון ולהריץ אותו על גבי כרטיסי מסך צרכניים פשוטים כמו Tesla T4 בענן החינמי של גוגל קולאב או כרטיסי RTX עם שמונה גיגהבייט זיכרון. הטעינה נעשית ישירות דרך ספריית transformers בפייתון עם הגדרות bfloat16 מתאימות.

אם המוצר שלכם צריך לעמוד בעומס של עשרות בקשות בשנייה או דורש חלון הקשר ענקי שחורג משמונת אלפים טוקנים, החזקת שרת ייעודי למודל כזה תהיה יקרה ואיטית ביחס לשליחת קריאות לשרתי ענן מנוהלים.

from transformers import pipeline

pipe = pipeline("text-generation", model="unsloth/llama-3-8b-Instruct-bnb-4bit")
print(pipe("שלום"))

הרישיון

השימוש כפוף לרישיון llama3 של מטא. הרישיון מתיר שימוש מסחרי ומחקרי באנגלית, כל עוד מצייתים למדיניות השימוש המקובלת שלהם. פיתוח בשפות שאינן אנגלית מותר רק אם מבצעים התאמה מיוחדת תוך עמידה בתנאי המדיניות.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗