GPT
L

Llama-3.2-3B-Instruct-bnb-4bit

קוד פתוח

unslothllama3.22024-09-25

  • transformers
  • safetensors
  • llama
  • text-generation
  • llama-3

גרסת 4 ביט מכווצת למודל ההוראות הקטן של מטא, שרצה ישירות על כרטיסי מסך בסיסיים בלי לתפוס כמעט מקום בזיכרון. פתרון מהיר כשרוצים מודל שיחה מקומי וזול.

  • 3.3Bפרמטרים
  • 131,072טוקנים בהקשר
  • 2.1 GBמשקל הקבצים
  • 60,566הורדות בחודש

מה זה

מטא בנתה את סדרת 3.2 הקטנה עבור משימות שיחה, סיכום ושליפת מידע בעבודה מול סוכנים. כאן מדובר בגרסת 3.3 מיליארד פרמטרים שעברה אופטימיזציה וכימות של bitsandbytes ל־4 ביט בידי צוות Unsloth. כל המשקלים יושבים על 2.1 גיגה בייט בלבד, מה שמוריד את דרישות המשאבים למינימום ומאפשר לטעון אותו תוך שניות.

המודל כולל ארכיטקטורת שנאי עם Grouped-Query Attention וחלון הקשר עצום של 131,072 טוקנים, תכונה נדירה במודלים בגודל כזה. לפי המפתחים, תהליך האימון של Unsloth חוסך כ־58% מהזיכרון ומריץ אימון מהיר פי 2.4 בהשוואה לקוד רגיל, מה שהופך את הבסיס הזה לנוח במיוחד למי שרוצה לבצע כוונון עדין על דאטה פנימי.

מתאים ל

  • בוט שיחה במשאבים נמוכים

    שוקל 2.1 גיגה בייט בלבד ורץ מצוין על חומרה זולה לניהול דיאלוג שוטף באנגלית.

  • סיכום טקסטים ארוכים

    חלון הקשר של 131,072 טוקנים מאפשר לקרוא מסמכים שלמים במודל קטן ומהיר.

  • אימון מותאם על דאטה פרטי

    הגרסה של Unsloth מותאמת לריצת fine-tuning מהירה וחסכונית על כרטיס T4 בודד.

איפה זה נופל

עברית לא נמצאת ברשימת שמונה השפות הנתמכות רשמית, שכוללת אנגלית, גרמנית, צרפתית, איטלקית, פורטוגזית, הינדי, ספרדית ותאי. המודל אמנם נחשף לשפות נוספות באימון, אבל אסור לבנות עליו לטקסט איכותי בעברית בלי לבצע כוונון עדין מראש. בנוסף, מודל בגודל 3.3 מיליארד פרמטרים מתקשה בהסקה לוגית מורכבת ומשימות תכנות כבדות בהשוואה למודלים של 8 מיליארד ומעלה.

אותה משפחה

Llama-3.2 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים ליישומים בעברית ישר מהקופסה?

לא מומלץ להסתמך עליו בעברית ללא אימון נוסף. מטא הגדירה שמונה שפות נתמכות רשמית ועברית אינה ביניהן, כך שהפלט עלול להיות משובש או מוגבל מאוד.

איזה כרטיס מסך צריך בשביל להריץ אותו?

המודל מכווץ ל־4 ביט ותופס מעט יותר מ־2 גיגה בייט על הזיכרון. כרטיס מסך בסיסי לחלוטין או מאיץ פשוט כמו Tesla T4 בחינם בקולאב מספיקים להרצה חלקה.

איך מריצים

בזכות הכימות ל־4 ביט, המשקל של 2.1 גיגה בייט מאפשר להריץ אותו בקלות על כרטיסי מסך פשוטים וחינמיים כמו Tesla T4 של גוגל קולאב או חומרה צרכנית שולחנית עם מעט זיכרון וידאו. הטעינה מתבצעת דרך ספריית transformers הרגילה, והוא מותאם ישירות לסביבת העבודה של Unsloth אם מתכננים אימון נוסף.

ההרצה המקומית שווה את המאמץ בעיקר אם אתם צריכים פרטיות מלאה או רוצים לחסוך עלויות תעבורה ושרתים בריצות תכופות. אם אתם צריכים רק קריאה פה ושם למשימות מורכבות ולא רוצים לתחזק שרת, שירותי ענן של מודלים גדולים יותר יתנו מענה בלי התעסקות בסביבות פייתון.

from transformers import pipeline

pipe = pipeline("text-generation", model="unsloth/Llama-3.2-3B-Instruct-bnb-4bit")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון הקהילה של Llama 3.2 מבית מטא. הוא מאפשר שימוש מסחרי חופשי לרוב החברות, כל עוד מצייתים למדיניות השימוש ההוגן שלהם, אך כולל הגבלות מיוחדות לארגונים ענקיים בעלי מאות מיליוני משתמשים חודשיים שנדרשים לאישור נפרד.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗