GPT
Q

Qwen-72B-Chat

קוד פתוח

Qwenother2023-11-29

  • transformers
  • safetensors
  • qwen
  • text-generation
  • custom_code

יש כאן גם סקירה על Qwen עצמו.

מודל שיחה בקוד פתוח עם 72 מיליארד פרמטרים שמתמחה בסינית ובאנגלית. הוא פונה למי שמחפש ביצועים חזקים במשימות קוד, מתמטיקה וקונטקסט ארוך של 32k טוקנים.

  • 72Bפרמטרים
  • 32,768טוקנים בהקשר
  • 135 GBמשקל הקבצים
  • 1,012הורדות בחודש

מה זה

מדובר בגרסת השיחה של משפחת המודלים מבית עליבאבא, שאומנה על יותר מ־3 טריליון טוקנים ועברה תהליכי יישור שיחה. הוא כולל אוצר מילים חריג בגודלו של כ־150 אלף טוקנים, מה שמאפשר לו לפרק טקסט ביעילות גבוהה יותר בשפות שאינן אנגלית ולטפל במספרים ברמת הספרה הבודדת.

במדדי ביצועים המודל מציג תוצאות גבוהות, עם 74.4 ב־MMLU באנגלית ו־80.1 ב־C-Eval בסינית בבדיקות אפס דוגמאות. בתחום הקוד והחישוב הוא מגיע ל־64.6 ב־HumanEval ו־76.4 ב־GSM8K ברמת דיוק מלאה, ומראה עמידות טובה גם בגרסאות מכווצות ששומרות על ציונים קרובים מאוד למקור.

מתאים ל

  • עיבוד טקסטים בסינית

    מציג דיוק של מעל 80 נקודות במבחני C-Eval ועבר אימון ייעודי עם אוצר מילים מורחב לשפה.

  • פתרון בעיות קוד ומתמטיקה

    משיג תוצאות גבוהות של 64.6 ב־HumanEval ומתאים לייצור קוד וניתוח אלגוריתמי מורכב.

  • ניתוח מסמכים ארוכים

    תומך בחלון הקשר מלא של 32,768 טוקנים באמצעות תשתית vLLM לשמירה על יציבות הזיכרון.

איפה זה נופל

הקוד ומשקלי המודל אינם חושפים תמיכה מובנית בעברית, שכן האימון והבדיקות ממוקדים באופן כמעט בלעדי בסינית ובאנגלית. ללא כוונון נוסף, עיבוד של עברית יסבול מאיטיות, שגיאות פירוק מילים והזיות.

מעבר לכך, בעבודה ללא Flash-Attention או בעומסי קונטקסט של מעל 14 אלף טוקנים ברמת דיוק נמוכה, המודל נוטה לקרוס מחוסר זיכרון גם על ארבעה כרטיסי שרת. יש צורך בהגדרה מדויקת של ניצול הזיכרון ב־vLLM כדי להימנע משגיאות זמן ריצה.

אותה משפחה

Qwen יצא ב־9 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב אישי חזק?

לא. גם בגרסת ה־Int4 המכווצת נדרשים לפחות 48 גיגה של זיכרון גרפי ייעודי, דרישה שכרטיסים ביתיים רגילים אינם מגיעים אליה. תצטרכו שרת ייעודי או לפחות שני כרטיסי מסך מקצועיים כדי לטעון אותו.

מה ההבדל בביצועים בין הגרסה הרגילה לגרסאות המכווצות?

הירידה בביצועים מינימלית ביותר במבחנים הרשמיים. ב־MMLU הציון יורד מ־74.4 ב־BF16 ל־73.4 ב־Int4, ובמתמטיקה הציון נשאר כמעט זהה, כך שעבור רוב השימושים גרסת ה־Int4 עדיפה בהרבה מבחינת חיסכון במשאבים.

איך מריצים

כדי להריץ אותו בפורמט המקורי נדרשים לפחות 144 גיגה זיכרון גרפי, כלומר שרת עם שני כרטיסי A100 של 80 גיגה או חמישה כרטיסי V100 של 32 גיגה. גרסת Int4 מורידה את הדרישה לכ־48 גיגה זיכרון גרפי ומאפשרת שימוש בכרטיס A100 בודד, אך דורשת שימוש ב־AutoGPTQ או בגרסת vLLM מותאמת.

בסביבות ייצור מומלץ להשתמש ב־vLLM בשילוב Flash-Attention 2, שמכפיל את קצב הפליטה ומגיע לעד כ־27 טוקנים לשנייה. אם אין לכם גישה לחוות שרתים מקומית של כמה כרטיסים ייעודיים, עלויות החומרה והתחזוקה הופכות את ההרצה העצמית ללא משתלמת בהשוואה לקריאה ישירה ל־API.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen-72B-Chat")
print(pipe("שלום"))

הקבצים

102 קבצים במאגר, 135 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הרשום בעמוד הוא מסוג other, מה שאומר שלא מדובר ברישיון קוד פתוח סטנדרטי כמו MIT או Apache. תנאי השימוש המסחריים, ההגבלות והזכויות אינם מוגדרים במלואם בכרטיס המודל, ולכן חובה לבדוק את קובץ הרישיון המקורי במאגר הקוד של עליבאבא לפני שילוב שלו במערכות מסחריות.

הרישיון המלא בעמוד המודל ↗