GPT
Q

Qwen2.5-32B-Instruct-AWQ

קוד פתוח

Qwenapache-2.02024-09-17

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • chat

יש כאן גם סקירה על Qwen עצמו.

גרסת 4 ביט של מודל 32B חזק שמתאימה לכרטיס מסך בודד של 24GB. מקבלים יכולות תכנות ומתמטיקה גבוהות בלי להחזיק שרת יקר.

  • 33Bפרמטרים
  • 32,768טוקנים בהקשר
  • 18.0 GBמשקל הקבצים
  • 727,207הורדות בחודש

מה זה

מדובר במודל הוראות מכווץ בשיטת AWQ שמביא ארכיטקטורה של 32.5 מיליארד פרמטרים לנפח של 18 גיגה בייט בלבד. השיפורים מול הדור הקודם מתמקדים בתכנות, מתמטיקה, הבנת נתונים מובנים כמו טבלאות, והקפדה על פורמט פלט בייחוד JSON. המודל מתמודד טוב יותר עם הנחיות מערכת מורכבות ומאפשר לבנות צ'אטבוטים בתפקידים מוגדרים בלי שיברחו מההוראות.

ברירת המחדל מגיעה עם חלון הקשר של 32,768 טוקנים, אבל תומכת בהרחבה עד 131,072 טוקנים באמצעות הגדרת YaRN בקונפיגורציה. היכולת לייצר עד 8,192 טוקנים בתשובה אחת מתאימה במיוחד לכתיבת קוד מלא או ניתוח מעמיק.

מתאים ל

  • חילוץ מידע ל־JSON

    מבין טבלאות ומייצר פלט מובנה בצורה מדויקת לפי סכמה, בלי לסטות מהפורמט.

  • סיוע בכתיבת קוד מקומי

    רץ על תחנת עבודה בודדת עם 24GB VRAM ומספק יכולות מתמטיקה ותכנות של מודל 32B.

  • בוט שיחה מבוסס תפקיד

    עוקב בדייקנות אחרי system prompt מורכב ולא שובר דמות גם בשיחות מתמשכות.

איפה זה נופל

אם מפעילים הרחבת הקשר מעבר ל־32K באמצעות YaRN ב־vLLM, הסקיילינג הסטטי עלול לפגוע בביצועים ובדיוק של טקסטים קצרים. בנוסף, המודל אומנם תומך רשמית ביותר מ־29 שפות, אבל עברית לא מצוינת ספציפית ברשימת השפות המרכזיות, כך שחובה לבדוק איכות פלט מול משימות מקומיות. נקודה נוספת היא התלות בגרסת transformers עדכנית, שכן גרסאות ישנות מ־4.37.0 נכשלות בטעינה.

אותה משפחה

Qwen2.5 יצא ב־29 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם כדאי להפעיל תמיד את ה־YaRN ל־128K טוקנים?

לא. המפתחים מזהירים שב־vLLM מיושם YaRN סטטי בלבד. הפעלתו הקבועה עלולה לפגוע באיכות התוצאות עבור טקסטים קצרים, ולכן יש להפעיל אותה רק כשבאמת מעבדים מסמכים חריגים באורכם.

איך דחיסת ה־AWQ משפיעה על איכות התשובות?

דחיסת 4 ביט בשיטת AWQ שומרת על המשקולות הקריטיות ומצמצמת את אובדן הדיוק מול מודל ה־float16 המקורי. הרווח העיקרי הוא האפשרות להכניס מודל 32B שלם לתוך 18GB זיכרון בלבד.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך מודרני עם לפחות 24GB זיכרון, כמו RTX 3090 או 4090. המשקל של הקבצים עומד על 18GB, כך שזה נכנס בזיכרון אבל משאיר מעט מרווח לטוקנים ארוכים, ולכן כדאי להרים אותו עם vLLM.

אם אתם צריכים רק שאילתות בודדות או חלון הקשר מלא של 128K עם קצב תעבורה גבוה, API חיצוני יחסוך כאב ראש. להרצה מקומית קבועה, זו גרסה שמאפשרת לחסוך קנייה של זוג כרטיסים בלי להקריב את גודל המודל.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen2.5-32B-Instruct-AWQ")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להריץ אותו באופן פרטי ולשלב אותו במוצרים מסחריים בלי תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗