GPT
L

llama-3.3-70b-instruct-awq

קוד פתוח

casperhansenllama3.32024-12-06

  • transformers
  • safetensors
  • llama
  • text-generation
  • conversational

גרסת קוונטיזציה מכווצת של מודל הדגל מבית מטא. מקבלים יכולות של 70 מיליארד פרמטרים במשקל 37.1 גיגה בייט, בלי לאבד ביצועים במשימות קוד ומעקב אחרי הוראות.

  • 71Bפרמטרים
  • 131,072טוקנים בהקשר
  • 37.1 GBמשקל הקבצים
  • 550,750הורדות בחודש

מה זה

מדובר באריזת AWQ של מודל ההוראות מסדרת Llama 3.3, שפותחה במקור על ידי מטא ועברה דחיסה בידי casperhansen. הדגם מבוסס על שמונים שכבות ומשתמש בטכניקת Grouped-Query Attention, שנועדה לחסוך זיכרון בזמן ריצה ארוכה ולהחזיק חלון הקשר של עד 131,072 טוקנים.

התוצאות במבחנים מראות שיפור חד ביחס לגרסת 70B הקודמת, בייחוד במקומות שחשובים לעבודה אמיתית. במבחן הקוד HumanEval הוא קופץ מציון של 80.5 ל־88.4, ובמתמטיקה מגיע ל־77 לעומת 68. במעקב אחרי הוראות מורכבות תחת IFEval הוא אפילו עוקף את גרסת ה־405B המקורית עם ציון 92.1 לעומת 88.6.

מתאים ל

  • פיתוח כלי קוד פנימיים

    עם ציון של 88.4 ב־HumanEval, הוא מייצר קוד ומאתר באגים ברמה קרובה מאוד למודל ה־405B.

  • עיבוד מסמכים ארוכים

    חלון הקשר של 128k טוקנים מאפשר לנתח תיקיות קוד או חוזים מלאים בלי צורך בחיתוך אגרסיבי.

  • סוכני אוטומציה מונחי פקודות

    תוצאת IFEval של 92.1 מבטיחה ציות מדויק למבני פלט קשיחים והנחיות מורכבות.

איפה זה נופל

רשימת השפות הרשמיות כוללת רק אנגלית, גרמנית, צרפתית, איטלקית, פורטוגזית, הינדי, ספרדית ותאילנדית. עברית לא מופיעה שם, ולכן היכולת לנסח תשובות קולחות או לתרגם ברמה גבוהה מוגבלת ולא מובטחת.

מעבר לזה, תאריך חיתוך המידע נעצר בדצמבר 2023. המודל לא יודע שום דבר על מה שקרה מאז, ובשימוש בכלים חיצוניים תחת מבחן BFCL הוא עומד על 77.3, כמעט ללא שינוי מהדור הקודם.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה על כרטיס RTX 4090 בודד?

לא. המודל שוקל 37.1 גיגה בייט, וכרטיס כזה מגיע עם 24 גיגה בייט זיכרון בלבד. כדי להעלות אותו תצטרכו לחלק את המשקלים בין שני כרטיסים כאלה לפחות.

איך הביצועים שלו בעברית?

הכרטיס לא מציין תמיכה בעברית אלא רק בשמונה שפות אחרות. הוא עשוי לפלוט עברית בסיסית, אבל יהיו טעויות דקדוק והבנה עמוקה לא תהיה שם בלי כוונון ייעודי.

איך מריצים

המשקל הכולל ירד ל־37.1 גיגה בייט, מה שאומר שאפשר לטעון אותו לתוך כרטיס מקצועי בודד עם 48 גיגה זיכרון כמו A6000 או שני כרטיסי 24 גיגה צרכניים. כדי להריץ את זה בפועל משתמשים בספריית AutoAWQ או ב־vLLM, שיודעות לעבוד ישירות עם הפורמט הזה ועם transformers.

אם אתם צריכים רק שאילתות בודדות ביום או שאין לכם חומרה כזו זמינה, להחזיק שרת ייעודי כזה פשוט יקר מדי. במקרים כאלה עדיף לפנות ל־API חיצוני שמתמחר לפי טוקנים, ולשמור את ההרצה המקומית למצבים שבהם המידע רגיש וחייב להישאר אצלכם ברשת.

from transformers import pipeline

pipe = pipeline("text-generation", model="casperhansen/llama-3.3-70b-instruct-awq")
print(pipe("שלום"))

הרישיון

הרישיון הוא Llama 3.3 Community License של מטא. הוא מתיר שימוש מסחרי ומאפשר להטמיע את המודל במוצרים, אך כפוף להסכם המקורי שלהם שכולל תנאי שימוש והגבלות הפצה ספציפיות.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗