GPT
Q

Qwen2-7B-Instruct

קוד פתוח

Qwenapache-2.02024-06-04

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • chat

יש כאן גם סקירה על Qwen עצמו.

גרסת שבעה מיליארד פרמטרים שמתחרה ישירות בדגמים מקבילים, עם דגש חזק על קוד ומענה להוראות. היא נכנסת לכרטיס מסך בודד ומתאימה למי שצריך ביצועים טובים בלי לשלם על שרת ענק.

  • 7.6Bפרמטרים
  • 32,768טוקנים בהקשר
  • 14.2 GBמשקל הקבצים
  • 389,681הורדות בחודש

מה זה

מדובר במודל שיחה מכוונן שנשען על ארכיטקטורת טרנספורמר עם שיפורים כמו Group Query Attention ו־SwiGLU. המפתחים אימנו אותו מראש על מאגרי מידע נרחבים ולאחר מכן ביצעו כוונון עדין מונחה לצד DPO כדי ליישר את התשובות לדרישות המשתמש.

במבחני ביצועים מול דגמים מקבילים כמו Llama 3 8B, הוא מציג יתרון ברור במשימות תכנות, למשל ציון של 79.9 ב־HumanEval לעומת 62.2 של המתחרה. הוא חזק גם במתמטיקה עם 82.3 ב־GSM8K, אבל במבחן הידע הכללי המדעי GPQA הוא משיג 25.3 בלבד, שזה נמוך יותר מחלק ממתחריו.

מתאים ל

  • עוזר פיתוח וכתיבת קוד

    המודל מוביל בבנצ'מרקים של קוד מול מתחריו ומספק דיוק גבוה בפתרון באגים וכתיבת פונקציות.

  • ניתוח מסמכים ארוכים

    באמצעות מנגנון YARN אפשר להזין קלטים באורך של עד 131 אלף טוקנים ישירות לשרת מקומי.

  • בוט שיחה על חומרה צנועה

    משקל של 14 גיגה בייט מאפשר פריסה מהירה על כרטיס מסך יחיד בלי צורך באשכול שרתים.

איפה זה נופל

הבעיה הבולטת ביותר נוגעת להרחבת ההקשר. vLLM תומכת כרגע רק ב־YARN סטטי, מה שאומר שהרחבת החלון לטקסטים ארוכים עלולה לפגוע ישירות באיכות התשובות עבור טקסטים קצרים. כמו כן, בבנצ'מרק GPQA המודל קיבל 25.3, שזה נתון חלש שמראה על קושי בשאלות ידע מורכבות במיוחד. בנוסף, המודל מוגדר רשמית עבור אנגלית וסינית בלבד, כך שאין שום הבטחה לאיכות סבירה בעברית.

אותה משפחה

Qwen2 יצא ב־13 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך מרחיבים את חלון ההקשר מעבר ל־32 אלף טוקנים?

עורכים את קובץ config.json ומוסיפים הגדרת rope_scaling מסוג yarn עם פקטור 4.0. לאחר מכן מריצים את המודל דרך vLLM לפי ההנחיות.

האם כדאי להפעיל את הרחבת ההקשר בכל מקרה?

לא. המפתחים מציינים שההרחבה הזו עלולה לפגוע באיכות התוצאות בטקסטים קצרים, ולכן עדיף להפעיל אותה רק כשבאמת יש צורך בקלט ארוך.

איך מריצים

כדי להריץ את המודל בדיוק המקורי שלו, bfloat16, צריך כרטיס מסך עם לפחות 16 עד 24 גיגה בייט זיכרון גרפי, בהתחשב בנפח קבצים של כ־14.2 גיגה בייט. המפתחים ממליצים להשתמש בספריית vLLM מגרסה 0.4.3 ומעלה, שמאפשרת גם לפתוח שרת מקומי במבנה של OpenAI.

חלון ההקשר המובנה הוא 32,768 טוקנים, אבל אפשר להרחיב אותו עד 131,072 טוקנים באמצעות הגדרת YARN בקובץ התצורה. אם אין לכם חומרה ייעודית זמינה, החזקה של שרת כזה בענן בשביל שאילתות בודדות תעלה יותר מפנייה ישירה ל־API מנוהל.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen2-7B-Instruct")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה חופשית בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗