GPT
Q

Qwen2.5-7B-Instruct-AWQ

קוד פתוח

Qwenapache-2.02024-09-17

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • chat

יש כאן גם סקירה על Qwen עצמו.

גרסה מכווצת בארבעה ביטים של מודל ההוראות הפופולרי, ששוקלת 5.2 גיגה בלבד. היא מיועדת למי שרוצה יכולות קוד וטבלאות חזקות על כרטיס מסך ביתי אחד.

  • 7.6Bפרמטרים
  • 32,768טוקנים בהקשר
  • 5.2 GBמשקל הקבצים
  • 3,593,565הורדות בחודש

מה זה

המודל מגיע עם 7.6 מיליארד פרמטרים אחרי כימות AWQ ב־4 ביט, מה שמקצץ את צריכת הזיכרון בלי לשבור את הביצועים. היוצרים שמו כאן דגש כבד על מתמטיקה, כתיבת קוד, הבנה של נתונים מובנים כמו טבלאות, ויצירת פלט בפורמט JSON לפי בקשה מדויקת. הוא יודע לעקוב אחרי הנחיות מערכת מורכבות יותר מבעבר ומסוגל לייצר תשובות ארוכות שמגיעות עד 8,192 טוקנים ברצף.

מבחינת שפות המודל מאומן על יותר מ־29 שפות שונות, ביניהן ערבית, רוסית, ספרדית ואנגלית. עברית לא מצוינת במפורש ברשימה של הכרטיס, כך ששווה לבדוק את איכות הפלט איתה לפני שבונים עליו לשוק המקומי.

מתאים ל

  • חילוץ מידע מטבלאות

    המודל אומן לקרוא מבנים מורכבים ולהוציא נתונים מסודרים בפורמט JSON תקני.

  • סוכן לכתיבת סקריפטים

    יכולות הקוד שלו שופרו משמעותית והוא רץ בזול על חומרה מקומית צנועה.

  • מענה מבוסס הנחיות מערכת

    הוא שומר על חוקים נוקשים של פרומפט מערכת בצורה עקבית לאורך השיחה.

איפה זה נופל

חלון ברירת המחדל עומד על 32,768 טוקנים, וכדי להגיע למקסימום של 131,072 טוקנים צריך להגדיר הרחבת YaRN בקונפיגורציה. בכרטיס המודל מזהירים שבפריסה ב־vLLM התמיכה בשיטה הזו סטטית, מה שעלול לפגוע בביצועים ובאיכות התשובות כששולחים טקסטים קצרים. בנוסף, כימות של 4 ביט תמיד גובה מחיר מסוים בדיוק לעומת משקלי המקור המלאים.

אותה משפחה

Qwen2.5 יצא ב־29 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

כמה זיכרון וידאו צריך בפועל כדי להריץ אותו?

הקבצים שוקלים 5.2 גיגה. כרטיס מסך פשוט עם 8 גיגה יספיק לטקסטים קצרים, אבל לחלון הקשר מלא עדיף כרטיס של 12 או 16 גיגה.

האם אפשר לעבד איתו מסמכים של מעל 100 אלף טוקנים מיד?

לא ישר מהקופסה. צריך להוסיף הגדרת YaRN לקובץ ההגדרות, וקחו בחשבון שבמנועים כמו vLLM זה עלול להוריד את האיכות של טקסטים קצרים.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך עם לפחות 8 עד 12 גיגה זיכרון וידאו, מה שאומר שכל כרטיס ביתי מודרני ממוצע יחזיק אותו בקלות. ההרצה דורשת שימוש בספריית transformers מגרסה 4.37 ומעלה כדי לא להיתקל בשגיאות טעינה, או פריסה דרך vLLM שמתאימה מאוד למי שצריך תפוקה יציבה בשרת.

אם אתם לא צריכים שרת פעיל מסביב לשעון ואין לכם כרטיס מסך זמין, עדיף פשוט לצרוך את המודל דרך ספק API חיצוני במקום לשלם על מכונה ייעודית בענן.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen2.5-7B-Instruct-AWQ")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא ופתוח. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע בתוך מוצרים סגורים ולהפיץ הלאה, בלי תמלוגים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗