GPT
L

llama-3-8b

קוד פתוח

unslothllama32024-04-18

  • transformers
  • safetensors
  • llama
  • text-generation
  • unsloth

גרסה מותאמת לאימון מהיר של המודל מבית מטא. מי שמוריד אותה מחפש לקצר זמני כוונון עדין ולחסוך זיכרון יקר במעבד הגרפי בלי להתעסק בהגדרות מורכבות.

  • 8Bפרמטרים
  • 8,192טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 11,504הורדות בחודש

מה זה

מדובר במשקלים של מודל השפה הבסיסי עם שמונה מיליארד פרמטרים, כפי שהוכנו על ידי צוות unsloth לעבודה ישירה בספריית transformers. המטרה כאן היא לא סתם להריץ טקסט, אלא לבצע אימון נוסף וכוונון עדין על דאטה משלכם ביעילות גבוהה יותר מהמשקלים הגולמיים.

לפי נתוני הכרטיס, תהליך האימון של המודל הזה מציג מהירות גבוהה פי 2.4 וצריכת זיכרון נמוכה ב־58 אחוזים בהשוואה להרצה רגילה. בפועל, החיסכון הזה בזיכרון מאפשר לאמן מודל של שמונה מיליארד פרמטרים אפילו על כרטיס בודד ופשוט יחסית כמו Tesla T4, בלי לקבל שגיאות חוסר זיכרון ובלי לשלם הון על שרתים כבדים.

התוצר הסופי אחרי שתסיימו לאמן מיועד לייצוא מהיר לפורמטים מוכרים כמו GGUF או הרצה ישירה בתוך מנועי הסקה דוגמת vLLM. הוא מתאים למי שרוצה להתחיל מטקסט גולמי באנגלית, לבצע fine-tuning ממוקד לפי צרכי הארגון, ולהפיק גרסה קלת משקל.

מתאים ל

  • אימון מודל על חומרה זולה

    צריכת הזיכרון הנמוכה ב־58 אחוז מאפשרת לבצע fine-tuning מלא על כרטיס T4 בודד בלי לשכור שרתי A100 יקרים.

  • השלמת טקסט באנגלית

    מודל הבסיס מצטיין ביצירת טקסט רציף לפי דפוס קיים, ומתאים למשימות ג'נרוט שאינן מבוססות על שאלות ותשובות.

  • ייצוא לפורמט GGUF

    לאחר סיום הכוונון העדין אפשר להמיר אותו ישירות לקבצים מכווצים שרצים בצורה חלקה במחשבים מקומיים.

איפה זה נופל

זהו מודל בסיס ליצירת טקסט ולא מודל שעבר התאמה לשיחה או ציות להוראות, כך שהוא פשוט ימשיך את הטקסט שתתנו לו במקום לענות כמו צ'אטבוט. השפה המוגדרת בו היא אנגלית בלבד, ואין לצפות ממנו לעבודה תקינה בעברית בלי אימון מקדים משמעותי. חלון ההקשר מוגבל ל־8,192 טוקנים, מה שלא יתאים למי שמנסה לנתח מסמכים ארוכים במיוחד.

אותה משפחה

llama-3 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה יודע לענות לשאלות כמו צ'אטבוט?

לא ישר מהקופסה. מדובר במודל בסיס שנועד להשלמת טקסט, ולכן הוא לא אומן להגיב להוראות או לנהל שיחה. כדי לקבל תוצאה כזו תצטרכו לאמן אותו בעצמכם על דאטהסט של שיחות או להשתמש בגרסת Instruct ייעודית.

אפשר להריץ עליו טקסטים ארוכים במיוחד?

חלון ההקשר שלו מוגבל ל־8,192 טוקנים בסך הכול. זה מספיק בהחלט לכמה עמודים של טקסט או קטעי קוד ממוקדים, אבל הוא ייכשל אם תנסו להזין לו ספרים שלמים או בסיסי ידע רחבים בבת אחת.

איך מריצים

כדי להריץ או לאמן אותו צריך כרטיס מסך עם מספיק VRAM כדי להחזיק 15 גיגה בייט של משקלים בדיוק bfloat16, לצד הזיכרון הנדרש להקשר של עד 8,192 טוקנים. הכרטיס מציע מחברת עבודה מוכנה ב־Google Colab שרצה על גבי Tesla T4 חינמי, כך שאין צורך להקים תשתית עצמאית יקרה רק כדי לבדוק את הביצועים.

אם כל מה שאתם צריכים זה רק לשלוח שאילתות טקסט פשוטות ולקבל תשובות, להחזיק שרת ייעודי בשבילו יהיה בזבוז זמן וכסף, ועדיף להשתמש ב־API חיצוני. ההרצה העצמית משתלמת ברגע שאתם נכנסים לתהליך של אימון והתאמה אישית של המשקלים על מידע פנימי.

from transformers import pipeline

pipe = pipeline("text-generation", model="unsloth/llama-3-8b")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון llama3 של חברת מטא. הוא מאפשר שימוש מסחרי ומחקר חופשי ברוב המקרים, אך כולל מגבלות ספציפיות על מוצרים בעלי מאות מיליוני משתמשים ודורש עמידה במדיניות השימוש של מטא. אם אתם בונים מוצר פנימי או שירות בהיקף רגיל, תוכלו להשתמש בו ולשחרר נגזרות שלו בכפוף לתנאים אלה.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗