GPT
Q

Qwen-14B-Chat

קוד פתוח

Qwenרישיון לא דווח2023-09-24

  • transformers
  • safetensors
  • qwen
  • text-generation
  • custom_code

יש כאן גם סקירה על Qwen עצמו.

מודל שיחה של עליבאבא שמציג יכולות קידוד, מתמטיקה והפעלת כלים חזקות במיוחד לגודל של 14 מיליארד פרמטרים. הוא מיועד למי שצריך ביצועים גבוהים בהרצה עצמית באנגלית או בסינית.

  • 14Bפרמטרים
  • 8,192טוקנים בהקשר
  • 26.4 GBמשקל הקבצים
  • 3,520הורדות בחודש

מה זה

מדובר במודל שיחה מיושר מהסדרה של עליבאבא שמבוסס על 14 מיליארד פרמטרים וארכיטקטורת רשת של 40 שכבות. הוא אומן על מגוון נתונים רחב של קוד, ספרים וטקסט רשת, וכולל אוצר מילים גדול מאוד של כ־150 אלף טוקנים שנשען על קידוד מורחב עבור שפות שונות ומספרים. מבנה המודל כולל שימוש ב־RoPE, פונקציית SwiGLU ו־RMSNorm, לצד תמיכה בהרחבת הקשר באמצעות מנגנוני NTK ו־LogN.

הייחוד הבולט שלו מול מודלים אחרים בקטגוריית 13B עד 14B נמצא במבחנים המעשיים. במבחן הקוד HumanEval הוא רושם ציון של 43.9 ב־zero-shot, ובמבחן המתמטיקה GSM8K הוא מגיע ל־60.1, תוצאות שעוקפות בפער ניכר מודלים פתוחים מקבילים כמו LLaMA2-13B ואפילו מתחרות בחלק מהמדדים בגרסת ה־70B. בנוסף, הוא מציג שגיאת False Positive נמוכה של 2.4 אחוזים בלבד בזיהוי והפעלת כלים חיצוניים דרך ReAct.

המודל מתוכנן במקור עבור שפות סינית ואנגלית, מה שבא לידי ביטוי בתוצאות גבוהות במיוחד בבנצ'מרקים C-Eval ו־MMLU. היכולת שלו לייצר קוד פייתון בר הרצה לצורכי פתרון בעיות וניתוח נתונים מציבה אותו כפתרון טכני מעניין למי שמפתח סוכנים אוטומטיים מקומיים.

מתאים ל

  • סוכן להפעלת כלים ו־API

    הוא השיג 98 אחוזי דיוק בבחירת כלים ורק 2.4 אחוזי שגיאות הפעלה שגויות במבחני ReAct.

  • הפקת סקריפטים ופתרון חישובים

    הוא מציג 89.2 אחוזי הרצה מוצלחת לקוד מתמטי ב־Code Interpreter וציון 43.9 ב־HumanEval.

  • ניתוח מסמכים באנגלית וסינית

    הוא מתמודד היטב עם טקסטים ארוכים בעזרת מנגנוני NTK ו־LogN, ומציג תוצאות גבוהות ב־MMLU.

איפה זה נופל

הכרטיס מדגיש מראש שהמודל אומן ותועד רק עבור אנגלית וסינית, כך שאין שום הבטחה או בדיקה לגבי עברית וסביר שהיא תעבוד גרוע. שנית, טעינה רגילה דרך ספריית הטרנספורמרס סובלת מירידה של כ־20 אחוז במהירות היצירה בהשוואה להרצה ישירה עם autogptq. בנוסף, חלון ההקשר מוגבל בברירת המחדל ל־2048 טוקנים, וכדי להגיע להקשרים ארוכים נדרש להפעיל ידנית דגלים כמו use_dynamic_ntk בקונפיגורציה. היכולת שלו להריץ כלי קוד דורשת ארכיטקטורת מעטפת חיצונית זהירה מפני שגיאות ביצוע.

אותה משפחה

Qwen יצא ב־9 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב אישי רגיל?

משקלי ה־BF16 המקוריים שוקלים מעל 26 ג'יגה בייט ודורשים לפחות 30 עד 40 ג'יגה בייט של זיכרון גרפי, כך שהם לא ירוצו על כרטיס ביתי פשוט. כדי לעבוד על חומרה מקומית נגישה יותר, תצטרכו להשתמש בגרסת ה־Int4 הרשמית שדורשת כ־13 עד 22 ג'יגה בייט זיכרון.

איך מפעילים תמיכה בטקסטים ארוכים מעבר ל־2048 טוקנים?

הארכיטקטורה הבסיסית מוגדרת ל־2048 טוקנים ברמת ברירת המחדל. כדי לעבד רצפים ארוכים יותר, עליכם להיכנס לקובץ config.json ולהגדיר ידנית את הפרמטרים use_dynamic_ntk ו־use_logn_attn כערכי true.

האם המודל מתאים לפיתוח מערכות בעברית?

לא מומלץ לבנות עליו לעברית. המודל אומן ונבדק על סינית ואנגלית בלבד, ואין בכרטיס שום עדות להתאמה לשפות אחרות מעבר להרחבת אוצר המילים הכללי.

איך מריצים

כדי להריץ אותו במשקל המקורי של 26.4 ג'יגה בייט בפורמט BF16, תצטרכו כרטיס מסך חזק עם לפחות 32 עד 40 ג'יגה בייט זיכרון גרפי, שכן קידוד של 2048 טוקנים מגיע לשיא של 30.15 ג'יגה בייט ויצירה של 8192 טוקנים דורשת כ־38.94 ג'יגה בייט. הסביבה דורשת פייתון 3.8 ומעלה, פייטארץ' מגרסה 2.0 ו־CUDA מגרסה 11.4 ומעלה, כשמומלץ להוסיף את ספריית flash-attention 2 לשיפור הקצב.

מי שאין לו כרטיס שרת כמו A100 יכול לפנות ישירות לגרסת ה־Int4 הרשמית שקיימת בריפו נפרד, אשר חותכת את צריכת הזיכרון ל־13 ג'יגה בייט בקידוד ורצה היטב על חומרה צרכנית בלי פגיעה מורגשת בבנצ'מרקים. אם אין לכם גישה למעבדים גרפיים ייעודיים או שאתם לא רוצים להתעסק בניהול תלויות של autogptq וספריות תאימות מותאמות אישית, עדיף להשתמש ב־API של DashScope.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen-14B-Chat")
print(pipe("שלום"))

הרישיון

הרישיון של המודל לא דווח ולא צוין בעמוד המאגר. מבחינה משפטית, היעדר רישיון מוגדר אומר שאין לכם היתר ברור להשתמש במשקלי המודל במוצר מסחרי, להפיץ אותו או לבנות עליו שירותים לחברות, ולכן חובה לברר את תנאי השימוש בריפו הרשמי בגיטהאב לפני כל שימוש בפועל.

הרישיון המלא בעמוד המודל ↗