GPT
L

Llama-3.3-70B-Instruct-bnb-4bit

קוד פתוח

unslothllama3.32024-12-06

  • transformers
  • safetensors
  • llama
  • text-generation
  • llama-3

גרסת 4 ביט חסכונית בזיכרון למודל הדגל של מטא, שמאפשרת להריץ יכולות של 70 מיליארד פרמטרים על חומרה מקומית נגישה יותר ובלי לוותר על חלון הקשר ענק.

  • 71Bפרמטרים
  • 131,072טוקנים בהקשר
  • 36.8 GBמשקל הקבצים
  • 12,849הורדות בחודש

מה זה

מדובר בהמרה מכווצת בשיטת bitsandbytes של מודל ההוראות Llama 3.3 70B, שפורסם בדצמבר 2024. הוא אומן על מעל 15 טריליון טוקנים ומיועד לשיחה, יצירת קוד והפעלת כלים חיצוניים דרך מנגנון קריאת פונקציות. חלון ההקשר שלו מגיע ל־128 אלף טוקנים, תכונה שחוסכת חיתוך מסמכים ארוכים.

במבחני הביצועים הוא סוגר את הפער מול מודלים ענקיים. הוא מקבל 88.4 אחוז במבחן HumanEval לקוד ו־77 במבחן MATH, תוצאות שגוברות על Llama 3.1 70B המקורי ומתקרבות מאוד לגרסת ה־405 מיליארד פרמטרים. השילוב בין שיפור היכולות לחיתוך בנפח הופך אותו לבסיס מעשי מאוד להתאמה אישית.

מתאים ל

  • פיתוח סוכני קוד פנימיים

    עם ציון של 88.4 אחוז ב־HumanEval ותמיכה בקריאת כלים, הוא מתאים מאוד לאוטומציות תכנות מקומיות.

  • אימון וסינתוז נתונים

    הרישיון מאפשר במפורש לייצר איתו דאטה סינתטי כדי לזקק מודלים קטנים ומהירים יותר לארגון.

  • ניתוח מסמכים טכניים באנגלית

    חלון של 128 אלף טוקנים מאפשר להזין תיעוד מלא, מפרטים ארוכים וספריות קוד שלמות בבת אחת.

איפה זה נופל

הנתונים עליו נעצרו בדצמבר 2023, כך שהוא לא מכיר שום דבר מהשנה האחרונה. מעבר לכך, רשימת השפות הנתמכות רשמית כוללת שמונה שפות בלבד: אנגלית, גרמנית, צרפתית, איטלקית, פורטוגזית, הינדי, ספרדית ותאילנדית. עברית אינה ברשימה, ולמרות שהוא ראה טקסטים ברשת, מטא מזהירה משימוש בשפות לא נתמכות בלי כוונון ייעודי ומנגנוני בקרה.

אותה משפחה

Llama-3.3 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יבין ויכתוב בעברית?

הוא יכול לייצר טקסט בעברית בגלל הדאטה מהרשת, אבל עברית אינה בין שמונה השפות הנתמכות רשמית בכרטיס המודל. מטא ממליצה לבצע פיין טיונינג ולהוסיף בדיקות לפני שמסתמכים עליו בשפות שאינן ברשימה.

כמה זיכרון וידאו צריך כדי להריץ אותו בפועל?

הקבצים שוקלים כמעט 37 גיגה בייט, אבל צריך לשריין מקום גם לטוקנים ולחלון ההקשר. בפועל תצטרכו סביבה של 48 גיגה בייט VRAM ומעלה כדי לעבוד איתו בצורה יציבה בלי קריסות של חוסר זיכרון.

איך מריצים

המשקל הכולל ירד ל־36.8 גיגה בייט ב־17 קבצים, אבל אל תבנו על כרטיס מסך ביתי בודד. כדי לטעון אותו עם מודל השפה, ההקשר וספריית transformers תצטרכו לפחות 48 גיגה בייט של זיכרון וידאו, מה שאומר שני כרטיסי RTX 3090 או A6000 יחיד.

אם יש לכם שרת ייעודי כזה בבית או בענן פרטי, ההרצה המקומית הגיונית. אם אתם צריכים רק שאילתות מדי פעם או עובדים עם כרטיס בודד של 16 או 24 גיגה בייט, עדיף להשתמש ב־API של ספק ענן ולא להסתבך עם פיצול זיכרון איטי ל־RAM.

from transformers import pipeline

pipe = pipeline("text-generation", model="unsloth/Llama-3.3-70B-Instruct-bnb-4bit")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון הקהילה של Llama 3.3. הוא מאפשר שימוש מסחרי ומחקר, ואפילו מתיר להשתמש בפלטים של המודל כדי לאמן ולזקק מודלים אחרים, כל עוד פועלים לפי מדיניות השימוש המקובלת של מטא ומצייתים לכללי הרישיון המקורי.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗