GPT
L

unsloth/Llama-3.3-70B-Instruct-GGUF

קוד פתוח

unslothllama3.32024-12-06

  • transformers
  • gguf
  • llama
  • text-generation
  • llama-3

גרסה מכווצת בפורמט GGUF של הדגם המוביל מבית מטא בגודל 70B. היא נותנת ביצועי קוד והיגיון שמתחרים בדגמי ענק, במבנה שמתאים להרצה מקומית על שרתים פרטיים.

  • 131,072טוקנים בהקשר
  • 1.2 TBמשקל הקבצים
  • 20,674הורדות בחודש
  • 126לייקים

מה זה

המאגר הזה מכיל המרות של Llama 3.3 70B לעבודה יעילה עם מעבדים וכרטיסים גרפיים. מטא אימנה אותו על מעל 15 טריליון טוקנים עם חלון הקשר של 128k, והוא עבר כוונון ייעודי לשיחות, כתיבת קוד והפעלת כלים חיצוניים.

במבחני ביצועים, השיפור מול דור 3.1 ניכר בעיקר ביכולת המעקב אחרי הוראות מורכבות, שם הוא מגיע לציון 92.1 ב־IFEval לעומת 87.5 בדגם הקודם. גם בתכנות יש קפיצה משמעותית עם 88.4 ב־HumanEval, ציון שנושק לדגם הענק של 405B, מה שאומר שבפועל מקבלים רמת דיוק גבוהה בהרבה בלי להחזיק תשתית מפלצתית.

מתאים ל

  • פיתוח כלי קוד פנימיים

    הוא מציג 88.4 במבחן HumanEval, ומספק חלופה מקומית מעולה לעבודה מול מאגרי קוד פרטיים.

  • יצירת דאטה סינתטי

    תנאי הרישיון מאפשרים זיקוק והפקת דאטה לאימון מודלים קטנים יותר ביעילות גבוהה.

  • עיבוד מסמכים ארוכים באנגלית

    חלון של 128k טוקנים ויכולת היגיון של 50.5 ב־GPQA מאפשרים לנתח מאמרים ודוחות מורכבים.

איפה זה נופל

המודל תומך רשמית בשמונה שפות בלבד: אנגלית, גרמנית, צרפתית, איטלקית, פורטוגזית, הינדי, ספרדית ותאילנדית. עברית לא ברשימה הזו, והמפתחים מזהירים בפירוש משימוש בשפות לא נתמכות בלי לבצע אימון נוסף ובדיקות בטיחות עצמאיות.

מעבר לזה, תאריך העדכון של נתוני האימון נעצר בדצמבר 2023, כך שהוא לא מכיר אירועים או ספריות מהזמן האחרון. בבדיקות של הפעלת כלים הוא קיבל 77.3 ב־BFCL v2, תוצאה זהה לדור הקודם, כך שבתחום הזה אין שיפור אמיתי.

אותה משפחה

Llama-3.3 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להוריד את כל המאגר בבת אחת?

ממש לא. המאגר שוקל 1.2TB ומכיל עשרות קבצים שמייצגים רמות כימות שונות. עליכם לבחור רק את הקובץ שמתאים לנפח הזיכרון שיש לכם בחומרה.

איך המודל מתמודד עם טקסטים בעברית?

הכרטיס מציין שמונה שפות נתמכות בלבד, ועברית אינה אחת מהן. המודל מסוגל לפלוט עברית מסוימת, אך המפתחים מזהירים משימוש כזה ללא בדיקות ואימון ייעודי.

איך מריצים

המשקל הכולל של הקבצים במאגר מגיע ל־1.2TB כי הוא כולל רמות שונות של כימות, אבל מורידים רק קובץ ספציפי. בשביל להריץ גרסת 4 ביט תצטרכו כרטיס עם לפחות 48GB זיכרון גרפי, כמו שני כרטיסי RTX 3090 או כרטיס A6000 בודד, אחרת הדגם יגלוש לזיכרון המערכת ויעבוד לאט מדי.

אפשר לטעון אותו ישירות דרך ספריות כמו Transformers עם bitsandbytes או מנועי הרצה מבוססי llama.cpp. אם אתם צריכים את המודל רק לניסויים או לעומסי עבודה נמוכים, החזקה של שרת כזה תעלה הרבה יותר משימוש ב־API חיצוני שמתמחר לפי טוקנים בפועל.

ollama run hf.co/unsloth/Llama-3.3-70B-Instruct-GGUF:Q5_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

42 קבצים במאגר, 1.2 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא רישיון הקהילה של Llama 3.3. הוא מאפשר שימוש מסחרי ומחקרי, וכולל היתר מפורש לייצר באמצעותו נתונים סינתטיים לצורך אימון וזיקוק של מודלים אחרים, בכפוף לתנאי השימוש ומדיניות הבטיחות של מטא.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗