GPT
Q

Qwen2-72B-Instruct

קוד פתוח

Qwenother2024-05-28

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • chat

יש כאן גם סקירה על Qwen עצמו.

גרסת 72 מיליארד הפרמטרים מציעה ביצועים שמתחרים בראש בראש מול Llama-3-70B במשימות קוד ומתמטיקה. הוא מתאים למי שצריך מודל פתוח חזק במיוחד ומוכן לשלם במשאבי חומרה כבדים.

  • 73Bפרמטרים
  • 32,768טוקנים בהקשר
  • 135 GBמשקל הקבצים
  • 28,878הורדות בחודש

מה זה

המודל מגיע מאומן מראש ועבר התאמה להוראות ושיפור באמצעות DPO. הוא נשען על ארכיטקטורת טרנספורמר עם 80 שכבות, Group Query Attention וטוקנייזר רחב שתומך בשפות מרובות ובקוד. המטרה כאן היא לתת מענה שלם למשימות מורכבות של פיתוח תוכנה, הסקת מסקנות ופתרון בעיות מתמטיות, בלי להסתמך על שירותי צד שלישי סגורים.

במבחני הביצועים של היוצרים הוא עוקף את Llama-3-70B-Instruct ברוב מדדי התכנות והחשיבה. ב־HumanEval הוא מגיע ל־86 אחוז לעומת 81.7, ובמבחן MATH הוא רושם פער משמעותי של 59.7 אחוז לעומת 50.4. המשמעות בפועל היא יכולת טובה יותר בכתיבת פונקציות מורכבות, הבנת שגיאות ופתרון בעיות כמותיות, לצד שיפור ניכר על פני הדור הקודם של אותה סדרה.

מתאים ל

  • מחולל ובודק קוד מורכב

    תוצאות מעולות במבחני HumanEval ו־EvalPlus הופכות אותו לכלי חזק לכתיבה וניתוח של קוד.

  • פתרון בעיות מתמטיות

    ציון של כמעט 60 אחוז בבנצ'מרק MATH מאפשר לו להתמודד בהצלחה עם חישובים ולוגיקה קשה.

  • סוכן שיחה רב שלבי

    עבר כוונון DPO קפדני שמסייע לו לעקוב אחרי הוראות מפורטות ולהחזיר תשובות מדויקות.

איפה זה נופל

היוצרים מזהירים מפורשות משימוש בהרחבת ההקשר ל־131 אלף טוקנים. הרחבה כזו דורשת הגדרת YARN ידנית בתוך קובץ ההגדרות, ומאחר ש־vLLM תומך כרגע רק ב־YARN סטטי, הפעלת ההרחבה פוגעת באיכות התשובות על טקסטים קצרים ורגילים. בנוסף, ברירת המחדל מוגבלת ל־32,768 טוקנים בלבד, כך שאי אפשר פשוט לזרוק עליו מסמכי ענק בלי לשנות קבצים ולקבל ירידה בביצועים השוטפים.

אותה משפחה

Qwen2 יצא ב־13 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך מפעילים תמיכה בקלט ארוך מעבר ל־32 אלף טוקנים?

צריך לערוך את קובץ config.json, להוסיף מקטע rope_scaling עם מנגנון yarn ופקטור 4.0, ולהריץ מעל vLLM. יש לקחת בחשבון שהפעולה הזו מורידה את איכות הפלט בטקסטים קצרים.

האם כדאי להריץ אותו לשימוש מקומי במשרד?

רק אם יש לכם שרת ייעודי עם לפחות 160 גיגה בייט של זיכרון וידאו מהיר. המשקל של הקבצים עומד על 135 גיגה בייט, כך ששום חומרה שולחנית רגילה לא תצליח לטעון אותו בצורה יעילה.

איך מריצים

כדי להעלות את משקלי ה־bfloat16 המקוריים, ששוקלים כ־135 גיגה בייט, צריך שרת עם לפחות שני כרטיסי A100 או H100 של 80 גיגה כל אחד. ההרצה המומלצת מתבצעת דרך vLLM החל מגרסה 0.4.3, שמאפשרת לחשוף שרת תואם ל־API של OpenAI, או ישירות דרך ספריית transformers מגרסה 4.37.0 ומעלה.

אם אין לכם קלאסטר כזה זמין באופן שוטף, התחזוקה העצמית של מפלצת כזו תהיה יקרה ולא משתלמת. במצב כזה, שימוש בממשק ענן חיצוני שמארח את המודל יחסוך את עלויות החומרה וההקמה המורכבות.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen2-72B-Instruct")
print(pipe("שלום"))

הקבצים

47 קבצים במאגר, 135 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון המדווח מוגדר כ־other ולא כרישיון קוד פתוח סטנדרטי כמו Apache או MIT. המשמעות היא שחובה לקרוא את תנאי השימוש המצורפים למאגר כדי להבין אם מותר להשתמש בו באופן מסחרי, מהן המגבלות על הפצה ללקוחות ואילו חובות חלות עליכם לפני שילוב שלו במוצר פעיל.

הרישיון המלא בעמוד המודל ↗