GPT
Q

Qwen2.5-7B-Instruct

קוד פתוח

Qwenapache-2.02024-09-16

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • chat

יש כאן גם סקירה על Qwen עצמו.

גרסת 7.6 מיליארד פרמטרים מותאמת הוראות שמביאה ביצועים חזקים בקוד, מתמטיקה ופלט מובנה. בחירה פופולרית מאוד למי שרוצה להריץ מודל חכם מקומית בלי לחנוק את השרת.

  • 7.6Bפרמטרים
  • 32,768טוקנים בהקשר
  • 14.2 GBמשקל הקבצים
  • 10,440,548הורדות בחודש

מה זה

מדובר במודל הוראות שמכוון לנקודת האיזון שבין משקל סביר ליכולת הסקה גבוהה. הוא נשען על 28 שכבות ומבנה שמפיק פלט של עד 8,192 טוקנים ברצף, עם התמחות מוצהרת במעקב אחר הנחיות מערכת מורכבות, ניתוח טבלאות והחזרת תשובות בפורמט מוגדר היטב כמו JSON.

היתרון הגדול שלו מול משקלים דומים הוא חיזוק מהותי ביכולות פיתוח תוכנה ופתרון בעיות מתמטיות, תחומים שבהם מודלים קטנים נוטים להישבר. מעבר לאנגלית, הוא אומן על מעל 29 שפות שונות, ומגיע עם תמיכה בהקשר בסיסי של 32,768 טוקנים שניתן להרחבה עד 131,072 טוקנים באמצעות מנגנון ייעודי.

למרות הגודל הפיזי הקומפקטי יחסית, הוא תוכנן לעמוד בעומסי פרומפטים מגוונים ותרחישי משחק תפקידים עבור צ'אטבוטים. זה הופך אותו לאחד הכלים הבולטים בקטגוריית המשקל שלו עבור שילוב ישיר בצד שרת.

מתאים ל

  • חילוץ מידע מובנה

    מייצר פלט JSON מדויק ומתמודד היטב עם טבלאות ונתונים קשיחים.

  • סיוע בכתיבת קוד

    מאומן באופן ייעודי על תכנות ומספק מענה חזק ביחס לגודל של 7B.

  • בוטים מבוססי הנחיות

    עמיד בשינויי System Prompts ומחזיק תפקידים וכללים לאורך שיחה.

איפה זה נופל

חלון ההקשר מוגדר כברירת מחדל ל־32,768 טוקנים, וכדי להגיע לתקרה המלאה של 131,072 טוקנים נדרש להפעיל הגדרת YaRN סטטית בקובץ התצורה. הכרטיס מזהיר במפורש ששימוש ב־YaRN סטטי ב־vLLM עלול לפגוע בביצועים ובאיכות התשובות על טקסטים קצרים, כך שלא מומלץ להפעיל את ההרחבה הזו סתם כך.

אותה משפחה

Qwen2.5 יצא ב־29 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך אפשר לפתוח את חלון ההקשר המלא של 128K?

צריך להגדיר ידנית rope_scaling מסוג yarn עם פקטור 4.0 בקובץ התצורה. יש לקחת בחשבון שבספריות כמו vLLM ההרחבה סטטית ועלולה להוריד איכות בטקסטים קצרים.

למה מופיעה שגיאת KeyError qwen2 בהרצה?

הארכיטקטורה של המודל נתמכת בספריית transformers רק מגרסה 4.37.0 ומעלה. שדרוג של החבילה פותר את הבעיה מיד.

איך מריצים

המשקל הגולמי עומד על 14.2 גיגה בייט בפורמט bfloat16, כך שתצטרכו כרטיס מסך עם לפחות 16 עד 24 גיגה בייט של VRAM כדי להריץ אותו כמו שצריך יחד עם זיכרון ההקשר. המפתחים ממליצים להשתמש בפריימוורקים כמו vLLM להגשה יעילה, ומחייבים גרסת transformers 4.37.0 ומעלה כדי לזהות את הארכיטקטורה.

אם יש לכם שרת ייעודי או סביבה מקומית חזקה, ההרצה משתלמת ומספקת פרטיות מלאה. אם אתם בונים שירות עם תעבורה נמוכה ומשתנה, הקמה ותחזוקה של מכונה כזו בענן תעלה יותר מקריאות API פשוטות לספק מנוהל.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen2.5-7B-Instruct")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0, רישיון קוד פתוח מתירני לחלוטין. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗