GPT
L

llama-3-8b-Instruct

קוד פתוח

unslothllama32024-04-18

  • transformers
  • safetensors
  • llama
  • text-generation
  • unsloth

גרסה מכווננת הוראות של לאמה 3 שמיועדת לאימון מהיר וחסכוני במשאבים. היא מתאימה למי שרוצה לאמן מודל שיחה עצמאי בלי לשרוף תקציב על שרתי ענק.

  • 8Bפרמטרים
  • 8,192טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 24,638הורדות בחודש

מה זה

מדובר במודל שפת בסיס של מטא שעבר התאמה של צוות אנלות' כדי לאפשר אימון עדין ומהיר ישירות דרך ספריית הטרנספורמרס. הוא מגיע במשקל מלא של 15 גיגה בייט בדיוק של bfloat16, אבל מותאם לעבודה ישירה בקוונטיזציה של 4 ביט עם bitsandbytes.

לפי נתוני הבדיקה של המפתחים, תהליך האימון של הדגם הזה מהיר פי 2.4 מצורת העבודה הרגילה וחוסך 58 אחוז בצריכת הזיכרון. בפועל זה אומר שאתם יכולים לקחת מודל הוראות עדכני של שמונה מיליארד פרמטרים, להריץ לו כוונון על דאטהסט משלכם, ולייצא אותו ישירות לפורמטים כמו GGUF או מנועי הסקה כמו vLLM בלי להסתבך בהמרות מורכבות.

מתאים ל

  • אימון צ'אטבוט ייעודי

    התאמה של המודל לשיחות תמיכה או שירות על בסיס דאטהסט שיחות קיים, בחצי מצריכת הזיכרון הרגילה.

  • אימון על כרטיס יחיד

    ביצוע כוונון עדין למשימות ספציפיות על חומרה זולה כמו כרטיס T4 בלי צורך בחוות שרתים יקרה.

  • ייצוא למנועי שרת מהירים

    אחרי אימון מהיר ניתן לייצא את התוצאה ישירות ל־GGUF או vLLM לחסכון בעלויות שרת הריצה.

איפה זה נופל

המודל הוגדר רשמית לשפה האנגלית בלבד, כך שאי אפשר לבנות עליו לפעולות מורכבות בעברית בלי אימון ייעודי משלכם. חלון ההקשר מוגבל ל־8,192 טוקנים, מה שלא יספיק לניתוח מסמכים ענקיים או בסיסי קוד רחבים. בנוסף, מדובר במודל קטן יחסית של שמונה מיליארד פרמטרים, מה שאומר שהוא עדיין נוטה להמציא עובדות בהוראות מורכבות.

אותה משפחה

llama-3 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית ישר מהקופסה?

הוא אומן וסומן רשמית עבור אנגלית בלבד. הוא מסוגל לקלוט מילים בסיסיות בעברית, אבל יתקשה מאוד בניסוחים מורכבים ולא מומלץ להסתמך עליו למוצר בעברית בלי לאמן אותו קודם על דאטה מתאים.

האם חייבים כרטיס מסך חזק כדי לאמן אותו?

לא. בזכות ההתאמות של אנלות' והעבודה ב־4 ביט, אפשר לבצע כוונון עדין מלא גם על כרטיס T4 חינמי בקולאב, בלי להתרסק מחוסר זיכרון.

איך מריצים

כדי להריץ או לאמן אותו צריך כרטיס מסך עם מספיק זיכרון להחזיק משקל של 15 גיגה בייט, או להשתמש בטעינה מכווצת ל־4 ביט שמאפשרת להריץ אותו אפילו על כרטיס T4 חינמי בודד של גוגל קולאב. המפתחים מספקים מחברות קוד מוכנות שמגדירות את כל סביבת העבודה בלחיצה אחת.

אם אתם צריכים רק שאלות ותשובות כלליות באנגלית בלי לגעת במשקלים ובלי צורך בהתאמה לדאטה פנימי, עדיף לפנות ל־API מסחרי קיים. הרצה עצמית שווה את הטרחה בעיקר כשאתם רוצים להזריק למודל ידע ארגוני ספציפי בתהליך אימון מלא.

from transformers import pipeline

pipe = pipeline("text-generation", model="unsloth/llama-3-8b-Instruct")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון לאמה 3 של מטא. הוא מאפשר שימוש מסחרי ומחקר, אך כפוף למגבלות המקוריות של מטא, כולל תנאי שימוש הוגן ומגבלת משתמשים חודשית של מאות מיליונים לפני שנדרש אישור מיוחד. אתם רשאים לשלב אותו במוצרים כל עוד אתם עומדים בתנאי הרישיון המקוריים.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗