GPT
L

unsloth/Llama-3.2-3B-Instruct

קוד פתוח

unslothllama3.22024-09-25

  • transformers
  • safetensors
  • llama
  • text-generation
  • llama-3

גרסה מותאמת לאימון מהיר של מודל ההוראות הקטן מבית מטא, שמיועדת בעיקר למי שרוצה לעשות פיין טיונינג בלי להשכיר שרתים יקרים. החוזק שלו הוא שילוב של גודל קומפקטי עם חלון הקשר עצום.

  • 3.2Bפרמטרים
  • 131,072טוקנים בהקשר
  • 6.0 GBמשקל הקבצים
  • 166,182הורדות בחודש

מה זה

המודל פותח על בסיס הארכיטקטורה של מטא ועבר התאמה של צוות unsloth כדי לאפשר אימון מהיר וחסכוני בזיכרון. מדובר במודל שפה קטן של 3.2 מיליארד פרמטרים שעבר אימון ייעודי להוראות באמצעות SFT ו־RLHF, ומכוון למשימות שיחה, סיכום, ושליפת מידע עבור סוכנים אוטונומיים.

לפי נתוני unsloth, השימוש בשיטות שלהם מאפשר לאמן אותו מהר יותר פי 2.4 ולחסוך 58 אחוז בצריכת הזיכרון ביחס לשיטות אימון רגילות. בנוסף הוא כולל מנגנון Grouped-Query Attention לשיפור מהירות ההסקה, ומציע חלון הקשר של 131,072 טוקנים, נתון חריג מאוד למודל במשקל נוצה שכזה.

מתאים ל

  • פיין טיונינג על חומרה זולה

    צריכת הזיכרון הנמוכה שלו מאפשרת לאמן אותו במהירות גם על כרטיס T4 יחיד וללא עלויות ענן כבדות.

  • סוכנים מבוססי שליפת מידע

    חלון של 131,072 טוקנים מאפשר להזין מסמכים ארוכים ישירות לתוך הפרומפט בלי לחתוך מידע.

  • בוטים ומשימות שיחה מקומיות

    הוא עבר כוונון ייעודי לשיחה ויכול לרוץ מקומית במהירות גבוהה בזכות מנגנון ה־GQA.

איפה זה נופל

עברית אינה מופיעה ברשימת שמונה השפות הנתמכות רשמית על ידי מטא, שכוללת רק אנגלית, גרמנית, צרפתית, איטלקית, פורטוגזית, הינדי, ספרדית ותאית. למרות שהמודל נחשף לשפות נוספות באימון, איכות הפלט בעברית דורשת בדיקה קפדנית ולא מובטחת מהקופסה.

מעבר לכך, מדובר במודל קטן יחסית שמאומן על מאגר סטטי, ולכן משימות שמצריכות היגיון מורכב או ידע מעמיק במיוחד יסבלו מטעויות לעומת מודלים גדולים.

אותה משפחה

Llama-3.2 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לעבודה שוטפת בעברית?

עברית אינה חלק משמונה השפות שנתמכות רשמית במודל. הוא נחשף לשפות נוספות מעבר לרשימה הרשמית, אבל אם אתם צריכים פלט איכותי בעברית, תצטרכו לבצע עליו פיין טיונינג ייעודי משלכם.

איזה כרטיס מסך צריך כדי לאמן אותו?

המודל שוקל 6 גיגה בייט בדיוק המקורי, ובזכות השיפורים של unsloth אפשר לאמן אותו על כרטיס מסך בסיסי עם 16 גיגה זיכרון כמו Tesla T4 החינמי ב־Colab.

איך מריצים

המשקל המקורי של הקבצים עומד על 6 גיגה בייט בדיוק bfloat16, כך שאפשר להריץ אותו אפילו על כרטיס בודד ופשוט כמו Tesla T4 החינמי ב־Google Colab. צוות unsloth מציע מחברות מוכנות שמאפשרות לייצא את התוצאה לפורמטים כמו GGUF או להרצה ישירה עם vLLM.

גרסאות מכווצות יותר בפורמט 4-bit זמינות באוסף שלהם וחוסכות עוד יותר מקום בזיכרון. אם אתם צריכים רק קריאות פשוטות בלי לאמן על דאטה משלכם או בלי דרישות פרטיות מקומיות, עדיף להשתמש ב־API מוכן ולחסוך תחזוקת שרת.

from transformers import pipeline

pipe = pipeline("text-generation", model="unsloth/Llama-3.2-3B-Instruct")
print(pipe("שלום"))

הרישיון

השימוש כפוף לרישיון הקהילתי של Llama 3.2. מדובר ברישיון מסחרי מותאם של מטא, שמתיר שימוש במוצרים מסחריים כל עוד עומדים במדיניות השימוש ההוגן ובמגבלות גודל המשתמשים שהוגדרו ברישיון המקורי.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗