GPT
Q

Qwen-7B

קוד פתוח

Qwenother2023-08-03

  • transformers
  • safetensors
  • qwen
  • text-generation
  • custom_code

יש כאן גם סקירה על Qwen עצמו.

מודל בסיס שמאומן על 2.4 טריליון טוקנים עם אוצר מילים עצום וביצועים חזקים במיוחד בקוד ובמתמטיקה. הוא רלוונטי למי שצריך תשתית אימון רב־לשונית עם תמיכה טובה בעברית.

  • 7.7Bפרמטרים
  • 32,768טוקנים בהקשר
  • 14.4 GBמשקל הקבצים
  • 31,973הורדות בחודש

מה זה

מדובר במודל בסיס בגודל 7.7 מיליארד פרמטרים מבית עליבאבא, שנועד ליצירת טקסט ולא לשיחה ישירה מהקופסה. נקודת החוזק המרכזית שלו היא שילוב של ארכיטקטורה סטנדרטית כמו RoPE ו־SwiGLU עם טוקנייזר רחב של מעל 150 אלף מונחים. אוצר המילים הזה מבוסס על cl100k ומכווץ היטב שפות שאינן אנגלית, כולל עברית וערבית, מה שחוסך טוקנים בזמן ריצה ומקל על התאמה לשפות נוספות.

במדדים שפורסמו הוא מציג יתרון ברור על מתחרים ישירים מאותו דור. במבחני קוד כמו HumanEval הוא מקבל 29.9 לעומת 12.8 של LLaMA2-7B, ובמתמטיקה של GSM8K הוא מגיע ל־51.7 מול 16.7 בלבד של המתחרה ממטא. המשמעות בפועל היא יכולת הסקת מסקנות וניתוח טכני גבוהה בהרבה ממה שהיה מקובל בגודל הזה, עוד לפני שעושים לו כוונון עדין למשימה ספציפית.

מתאים ל

  • בסיס לאימון והתאמה אישית

    הוא אומן על 2.4T טוקנים ונותן נקודת זינוק חזקה מאוד למשימות ממוקדות בעזרת LoRA או פיין־טיונינג מלא.

  • עיבוד טקסט רב־לשוני ועברית

    הטוקנייזר שלו כולל 151,851 מונחים ומציג דחיסה גבוהה בעברית, מה שמוזיל עלויות חישוב ומשפר יעילות.

  • משימות קוד והיגיון מתמטי

    ציונים של 29.9 ב־HumanEval ו־51.7 ב־GSM8K הופכים אותו לאחד החזקים בקטגוריה שלו לכתיבת סקריפטים וחישובים.

איפה זה נופל

זהו מודל בסיס טהור, לא גרסת Chat שעברה יישור והנחיות, ולכן הוא ייטה להשלים טקסטים במקום לענות על פקודות ישירות בלי כוונון מקדים. בנוסף, למרות שהארכיטקטורה תומכת טכנית ב־32 אלף טוקנים, מדד ה־PPL בבדיקות קופץ מ־3.3 ב־8K ל־181 ב־32K אם לא מפעילים ידנית התאמות כמו NTK וחלונות קשב. התלות בספריות חיצוניות כמו tiktoken ו־Flash Attention עלולה לגרום לבעיות תאימות בהטמעה בצינורות עיבוד קיימים.

אותה משפחה

Qwen יצא ב־9 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו ישירות כצ'אטבוט?

לא מומלץ. זהו מודל בסיס שנועד להשלמת טקסט, וכדי לקבל ממשק של שיחה והוראות עדיף להשתמש בגרסת Qwen-7B-Chat המיועדת לכך, או לאמן אותו בעצמכם על נתוני שיחה.

איך מפעילים הקשר ארוך של 32K בלי שהתוצאות יתפרקו?

ברירת המחדל הבטוחה היא עד 8K טוקנים. כדי לעלות מעבר לזה בלי לפגוע באיכות הפלט, חייבים לערוך את קובץ ה־config ולהגדיר את use_dynamic_ntk ו־use_logn_attn כערכי אמת, בשילוב חלונות קשב.

האם המודל מותר לשימוש מסחרי באפליקציה?

הקוד והמשקלים ניתנים להורדה, אך הרישיון המסחרי אינו חופשי לגמרי. עליבאבא דורשת הגשת טופס בקשה ייעודי כדי לאשר שימוש מסחרי במוצרים.

איך מריצים

המשקלים תופסים 14.4 גיגה־בייט, כך שכדי להריץ אותו בפורמט המקורי תצטרכו כרטיס מסך עם לפחות 16 עד 24 גיגה זיכרון וידאו, לצד התקנה של PyTorch וספריית tiktoken. כדי לקבל ביצועים סבירים בזיכרון נמוך יותר, היוצרים ממליצים במפורש לקמפל ולהתקין את Flash Attention 2, שדורש CUDA 11.4 ומעלה ומסבך מעט את סביבת העבודה.

מי שרוצה למתוח את ההקשר מעבר לברירת המחדל יצטרך להפעיל בהגדרות מנגנוני dynamic_ntk ו־LogN. אם אין לכם חומרה ייעודית לתחזוקה שוטפת של שרת כזה או שאתם רק רוצים לבדוק את היכולות שלו מול משתמשים, עדיף לפנות ל־API הרשמי של עליבאבא במקום להתעסק בקימפול דרייברים והקצאת משאבים מקומית.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen-7B")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ומבוסס על הסכם הרישוי הייעודי של Tongyi Qianwen. הוא פתוח לחלוטין למחקר אקדמי, אך שימוש מסחרי במוצר דורש מילוי טופס בקשה רשמי וקבלת אישור מעליבאבא.

הרישיון המלא בעמוד המודל ↗