GPT
Q

Qwen-1_8B

קוד פתוח

Qwenרישיון לא דווח2023-11-30

  • transformers
  • safetensors
  • qwen
  • text-generation
  • custom_code

יש כאן גם סקירה על Qwen עצמו.

מודל בסיס שדורש פחות מ־2GB זיכרון ומספק תוצאות חזקות לאנגלית וסינית. הפתרון מתאים למי שרוצה לאמן או להריץ מודל מקומי על חומרה חלשה.

  • 1.8Bפרמטרים
  • 8,192טוקנים בהקשר
  • 3.4 GBמשקל הקבצים
  • 1,658הורדות בחודש

מה זה

מדובר במודל שפה גולמי של עליבאבא שמבוסס על ארכיטקטורת שנאי עם 24 שכבות, ואומן על מעל 2.2 טריליון טוקנים של טקסט, קוד ומתמטיקה. להבדיל ממודלים קטנים אחרים שמציעים חלון הקשר קצר, כאן יש תמיכה ב־8,192 טוקנים ומילון מורחב של מעל 150 אלף מונחים. המילון הזה מבוסס על tiktoken ומספק דחיסה יעילה לא רק לאנגלית ולסינית, אלא גם לשפות כמו עברית, ערבית ורוסית.

במבחני הביצועים הוא עוקף בבירור מודלים ותיקים במשקל מקביל כמו Bloom או Pythia. במבחן MMLU הוא עומד על 45.3 אחוז דיוק מול סביבות ה־27 של המתחרים, ובמתמטיקה על GSM8K הוא מגיע ל־32.3 אחוז לעומת בודדים אצל האחרים. במבחן הקוד HumanEval הוא מחזיר 15.2 אחוז פתרונות נכונים בריצה ראשונה. המספרים האלה מראים בסיס מוצק למשימות ממוקדות, אבל צריך לזכור שזהו מודל בסיס להשלמת טקסט ולא צ'אט שמגיב להוראות ישר מהקופסה.

מתאים ל

  • אימון מודל קל על מידע פנימי

    דרישת סף של 6GB בלבד לכוונן עדין מאפשרת לאמן אותו על שרתים פשוטים או מחשבי פיתוח.

  • השלמת טקסט בסיסית במכשירי קצה

    גרסאות ה־int4 רצות בפחות מ־2GB של זיכרון ומאפשרות משימות השלמה ללא חיבור ענן.

  • עיבוד מסמכים באורך בינוני

    חלון של 8,192 טוקנים מאפשר הזנת טקסטים ארוכים יחסית למודלים בגודל כזה.

איפה זה נופל

זהו מודל השלמת טקסט בסיסי ולא מודל שעבר התאמה לשיחה. הוא לא יודע לענות לשאלות ישירות אלא ממשיך את הטקסט שהזנתם, ומצריך פרומפטים מובנים מאוד או תהליך אימון נוסף כדי לתפקד כעוזר. בנוסף, למרות שהמילון תומך בעברית ביעילות, המודל אומן ונבדק בעיקר על סינית ואנגלית, כך שביצועי ההבנה והידע בעברית לא נמדדו כלל בכרטיס ודורשים בדיקה זהירה. דיוק של 15.2 אחוז בקוד ו־32.3 אחוז במתמטיקה מראה שאי אפשר להסתמך עליו למשימות חישוב או תכנות מורכבות.

שאלות
נפוצות

האם המודל מוכן לשימוש כצ'אט?

לא. מדובר במודל בסיס שמשלים רצפי מילים. לשיחה צריך להשתמש בגרסת ה־Chat הייעודית או לאמן אותו בעצמכם על דוגמאות של שיחה והוראות.

איך הביצועים שלו בעברית?

המילון שלו מכיל ייצוג יעיל לאותיות בעברית שמקטין את מספר הטוקנים, אבל האימון התמקד בעיקר באנגלית וסינית. נדרש לבדוק את איכות הפלט בפועל לפני שמסתמכים עליו בעברית.

האם אפשר להשתמש בו ישירות באפליקציה מסחרית?

לא באופן אוטומטי. הרישיון המוגדר הוא הסכם מחקר, ויוצרי המודל דורשים פנייה ישירה במייל לקבלת אישור מסחרי.

איך מריצים

בפועל אפשר להריץ אותו דרך ספריית transformers בגרסה 4.32.0 עם tiktoken, einops ו־accelerate, כאשר התקנה של flash-attention 2 חוסכת זיכרון ומאיצה את העבודה. בגרסאות מכווצות של int4 או int8 ההסקה צורכת פחות מ־2GB של זיכרון כרטיס מסך, וגם ביצירת 2,048 טוקנים הצריכה עומדת על כ־3GB בלבד. מי שמתכנן לעשות לו אימון נוסף יוכל להסתפק ב־6GB זיכרון.

אם אתם צריכים רק מענה מהיר בשיחה חופשית בלי להתעסק בהתאמות, עדיף להשתמש בגרסת הצ'אט שלו או לפנות ל־API חיצוני. הרצה מקומית של מודל הבסיס הזה משתלמת רק אם יש לכם צורך באימון מותאם על דאטה פנימי, או במערכת קצה שחייבת לפעול ללא רשת.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen-1_8B")
print(pipe("שלום"))

הרישיון

הרישיון לא מוגדר בקבצי ההפצה, אך כרטיס המודל מציין הסכם מחקר ייעודי. הקוד והמשקלים פתוחים לחלוטין לצורכי מחקר אקדמי בלבד. לשימוש מסחרי במוצר נדרשת פנייה ישירה לעליבאבא ואישור מראש, כך שאי אפשר להטמיע אותו במערכת מסחרית בלי הסדרה משפטית.

הרישיון המלא בעמוד המודל ↗