GPT
Q

Qwen-14B

קוד פתוח

Qwenרישיון לא דווח2023-09-24

  • transformers
  • safetensors
  • qwen
  • text-generation
  • custom_code

יש כאן גם סקירה על Qwen עצמו.

מודל בסיס בגודל 14 מיליארד פרמטרים עם אוצר מילים חריג של מעל 150 אלף טוקנים. הוא מציע ביצועים חזקים במתמטיקה ובקוד לעומת מתחרים בגודלו.

  • 14Bפרמטרים
  • 8,192טוקנים בהקשר
  • 26.4 GBמשקל הקבצים
  • 5,840הורדות בחודש

מה זה

מדובר במודל בסיס שאומן על יותר מ־3 טריליון טוקנים של טקסט, קוד ומתמטיקה. הדגש כאן הוא על מילון רחב במיוחד המבוסס על tiktoken, שכולל דחיסה יעילה לא רק לאנגלית ולסינית אלא גם לשפות כמו עברית, ערבית ורוסית. הארכיטקטורה משתמשת בחידושים המקובלים כמו SwiGLU, RMSNorm וקידוד מיקום יחסי מסוג RoPE.

במדדים שפורסמו הוא מציג תוצאות עדיפות על פני LLaMA2-13B כמעט בכל מבחן. ב־GSM8K הוא מגיע ל־61.3 לעומת 29.6 של המתחרה, וב־HumanEval הוא מקבל 32.3 לעומת 18.9. המשמעות היא יכולת ניתוח לוגית וכתיבת קוד טובה משמעותית ממה שהיה מקובל בגזרת ה־13 וה־14 מיליארד פרמטרים בעת שחרורו.

מתאים ל

  • בסיס לאימון מודל קוד ייעודי

    התוצאות במבחני HumanEval ו־MBPP גבוהות מהמתחרים, מה שנותן נקודת פתיחה מצוינת לכוונון עדין.

  • עיבוד טקסטים רב־לשוניים

    המילון הענק מכווץ שפות כמו עברית ורוסית ביעילות גבוהה וחוסך טוקנים בעיבוד נתונים.

  • פתרון בעיות חישוב ומדע

    ציונים מרשימים של 61.3 ב־GSM8K הופכים אותו למועמד טוב למשימות היגיון ומתמטיקה.

איפה זה נופל

זהו מודל בסיס נקי, ולכן הוא לא יודע לענות לשאלות כמו עוזר שיחה אלא פשוט ממשיך את הטקסט שהזנתם. אם לא תבצעו כוונון עדין או התאמת הוראות, תקבלו השלמות טקסט אקראיות ולא שיחה קוהרנטית.

בנוסף, הרחבת חלון ההקשר מעבר ל־2,048 טוקנים ועד 8,192 דורשת הפעלה ידנית של דגלים כמו use_dynamic_ntk ו־use_long_attn בקובץ ההגדרות. ללא ההגדרות האלה, ה־Perplexity מזנק מ־3.46 ל־334 באורכים של 8,192 טוקנים והפלט נהרס לגמרי.

אותה משפחה

Qwen יצא ב־9 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה מתאים לשימוש ישיר כצ'אטבוט?

לא. מדובר במודל בסיס שאומן להשלמת טקסט בלבד ולא עבר יישור של שיחה. אם אתם מחפשים בוט לתמיכה או שיחה, עליכם להשתמש בגרסת Qwen-14B-Chat או לאמן אותו בעצמכם על דאטה של שיחות.

איך גורמים לו לעבוד עם הקשר של 8,192 טוקנים בלי שהפלט ישתבש?

ברירת המחדל עומדת על 2,048 טוקנים. כדי להגיע ל־8K יש להפעיל בקובץ ההגדרות את use_dynamic_ntk ואת use_long_attn, אחרת המודל מאבד יציבות לחלוטין ברצפים ארוכים.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־26.4 גיגה בייט. כדי לטעון אותו בדיוק מלא תצטרכו כרטיס מסך עם לפחות 30 עד 32 גיגה בייט זיכרון גרפי, למשל A100 או זוג כרטיסי RTX 3090, לצד התקנה של flash-attention 2 לחיסכון במשאבים.

מי שאין לו תשתית כזו במשרד יעדיף להשתמש ב־API של Alibaba Cloud דרך DashScope, או לכייל אותו בגרסאות קוונטיזציה. אם אתם צריכים צ'אט ולא השלמת טקסט, עדיף לפנות לגרסת ה־Chat המיושרת.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen-14B")
print(pipe("שלום"))

הרישיון

הרישיון בעמוד הראשי מוגדר כלא דווח, אך המפתחים מציינים כי המחקר פתוח לשימוש חופשי. שימוש מסחרי מותנה במילוי טופס בקשה מקוון ובאישור של Alibaba, כך שאי אפשר לשלב אותו במוצר מסחרי באופן חופשי ומיידי.

הרישיון המלא בעמוד המודל ↗