GPT
Q

Qwen2-1.5B-Instruct

קוד פתוח

Qwenapache-2.02024-06-03

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • chat

יש כאן גם סקירה על Qwen עצמו.

גרסת שיחה קטנה שמיועדת לרוץ ישירות על מכשירי קצה או שרתים חלשים בלי לקרוע את התקציב. היא מביאה חלון הקשר ארוך במיוחד לגודל כזה של קבצים.

  • 1.5Bפרמטרים
  • 32,768טוקנים בהקשר
  • 2.9 GBמשקל הקבצים
  • 707,528הורדות בחודש

מה זה

מדובר במודל שפה קטן עם התאמה להוראות, שנועד לייצר טקסט וקוד במקומות שבהם משקל ומשאבים הם בעיה. עם קצת יותר ממיליארד וחצי פרמטרים, הוא שוקל פחות משלושה גיגה בייט בדיוק המקורי שלו. הארכיטקטורה כוללת שיפורים מוכרים כמו group query attention ואימון בשלבי finetuning ו־DPO, מה שמאפשר לו להחזיק שיחה מסודרת למרות הגודל הזעיר.

המספרים במבחנים מראים קפיצה ממשית לעומת הדור הקודם בגודל דומה. ב־GSM8K הוא זינק ל־61.6 לעומת 35.3 בגרסת 1.8B הקודמת, וב־HumanEval הוא טיפס ל־37.8, מה שאומר שהוא מסוגל להתמודד עם לוגיקה פשוטה וקטעי קוד בסיסיים בלי להתבלבל מיד. עם זאת, דיוק ההוראות הקפדני שלו ב־IFEval עומד על 29.0 בלבד, כך שלא צריך לצפות ממנו למשמעת עיוורת בכללים מורכבים.

מתאים ל

  • בוט מקומי על מכשירי קצה

    משקל של פחות משלושה גיגה מאפשר להריץ מענה טקסטואלי מקומי על מחשב אישי בלי תלות בחיבור רשת.

  • ניתוח מסמכים ארוכים

    חלון הקשר של 32,768 טוקנים נדיר במודלים זעירים כאלה ומאפשר לסרוק טקסט ארוך בלי לחתוך אותו לפסקאות.

  • סיווג ותמצות קל של טקסט

    מבצע משימות עיבוד שפה שגרתיות במהירות גבוהה ובמינימום צריכת משאבים בהשוואה למודלי ענק יקרים.

איפה זה נופל

למרות השיפורים, זה עדיין מודל של מיליארד וחצי פרמטרים. ציון של 29.0 ב־IFEval חושף חולשה מובהקת בעמידה בהנחיות נוקשות כמו מבני פלט מורכבים או אילוצי אורך מחמירים. בנוסף, נתוני המודל מצהירים רשמית רק על אנגלית, כך שאין שום הבטחה לתמיכה סבירה בעברית. לפני שמכניסים אותו למערכת שצריכה לתת מענה בעברית, חובה לבדוק אם הוא בכלל מחזיר טקסט קוהרנטי או מתחיל להמציא מילים.

אותה משפחה

Qwen2 יצא ב־13 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם המודל יודע לעבוד בעברית?

הכרטיס מצהיר רשמית רק על אנגלית, למרות שהטוקנייזר שלו מותאם למספר שפות. מודל בגודל 1.5B שלא אומן ישירות על עברית לרוב יפיק פלט מגומגם או שגוי, ולכן צריך לבדוק אותו ידנית על המשימה שלכם ולא להסתמך עליו בעיניים עצומות.

איזה חומרה מינימלית צריך כדי להרים אותו?

המשקל של הקבצים עומד על 2.9 גיגה בייט. מספיק כרטיס מסך פשוט עם ארבעה גיגה זיכרון כדי להחזיק אותו בדיוק המקורי, ואפשר להריץ אותו אפילו על מעבד רגיל של לפטופ בלי להרגיש איטיות קיצונית.

איך מריצים

כדי להריץ אותו צריך התקנה עדכנית של ספריית transformers מגרסה 4.37.0 ומעלה, אחרת תקבלו שגיאת מפתח. כל כרטיס מסך בסיסי או מחשב נייד עם מעבד סביר יכולים לטעון את שלושת הגיגה האלה לזיכרון בלי להזיע, אפילו בלי לכווץ את הדיוק מ־bfloat16.

אם אתם צריכים רק כמה קריאות ביום ולא רוצים להתעסק עם שרתים או לתחזק מכונה, עדיף להשתמש ב־API מוכן של שירות ענן. מצד שני, אם אתם חייבים שהמידע יישאר מקומית על לפטופ של משתמש או בתוך רשת פנימית בלי גישה לרשת, להריץ אותו בעצמכם זו הבחירה הכי הגיונית.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen2-1.5B-Instruct")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0, שזה רישיון קוד פתוח מתירני ונוח. אתם יכולים להשתמש בו במוצרים מסחריים, לשנות אותו, להטמיע אותו בתוך אפליקציה ולשלוח אותו ללקוחות בלי לשלם תמלוגים, כל עוד אתם שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗