GPT
Q

Qwen1.5-1.8B-Chat

קוד פתוח

Qwenother2024-01-30

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • chat

יש כאן גם סקירה על Qwen עצמו.

מודל שיחה קל משקל שרץ כמעט על כל מחשב או שרת זול. הוא מביא חלון הקשר של 32K טוקנים בלי צורך בהגדרות מיוחדות, ומתאים למי שחייב מודל מקומי קטן שלא תופס מקום.

  • 1.8Bפרמטרים
  • 32,768טוקנים בהקשר
  • 3.4 GBמשקל הקבצים
  • 30,941הורדות בחודש

מה זה

מדובר בגרסת צ'אט עם 1.8 מיליארד פרמטרים מסדרת Qwen1.5, שהיא גרסת הבטא לקראת Qwen2. המודל עבר אימון מקדים על נפח דאטה גדול, ואחריו כוונון עדין ואופטימיזציה ישירה להעדפות אנושיות כדי לתפקד בשיחה. הוא שוקל רק 3.4 גיגה בייט בפורמט bfloat16, כך שהוא נטען במהירות ונכנס בקלות לזיכרון של כרטיסי מסך בסיסיים.

הייחוד העיקרי כאן הוא התמיכה היציבה בחלון הקשר של 32,768 טוקנים, תכונה שלרוב שמורה למודלים כבדים בהרבה. בנוסף, הקוד שלו כבר נתמך ישירות בספריית transformers החל מגרסה 4.37.0, כך שלא צריך לאפשר הרצת קוד מרוחק כדי לטעון אותו.

מתאים ל

  • בוט שיחה על חומרה חלשה

    משקל של 3.4 גיגה מאפשר להריץ אותו ישירות על מחשב נייד או שרת זול בלי כרטיס מסך יקר.

  • סיכום טקסטים ארוכים במכשיר

    חלון של 32K טוקנים במודל קטן מאפשר להכניס מסמכים שלמים לעיבוד מקומי ומאובטח.

  • סיווג וניסוח תשובות מהיר

    הגודל הקומפקטי מייצר טוקנים בקצב גבוה ומתאים למשימות ניסוח שאינן דורשות ידע עמוק.

איפה זה נופל

זה מודל בטא של 1.8B, ולכן כושר ההסקה שלו מוגבל מאוד מול מודלים גדולים. היוצרים מודים במפורש שיש בעיות כמו החלפת שפות לא רצויה באמצע תשובה או פלטים פגומים, וממליצים להשתמש בהגדרות המדויקות מקובץ התצורה כדי למזער את זה. בנוסף, גרסת הבטא הזו לא כוללת שיפורי ארכיטקטורה מסוימים כמו GQA שהושארו רק לגדלים אחרים.

אותה משפחה

Qwen1.5 יצא ב־21 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איזו גרסת transformers חובה להתקין כדי שהוא יעבוד?

היוצרים מציינים שחייבים גרסה 4.37.0 ומעלה. אם תנסו לטעון אותו בגרסה ישנה יותר, תקבלו שגיאת KeyError על ארכיטקטורת qwen2.

מה לעשות אם המודל מתחיל לערבב שפות או להזות?

הצוות ממליץ להשתמש בפרמטרי היצירה שנמצאים בתוך generation_config.json של המודל. הגדרות אלו נקבעו במיוחד כדי להפחית מקרים של קוד סוויצ'ינג ושיבושים בטקסט.

איך מריצים

כדי להריץ אותו צריך בסך הכל כרטיס מסך פשוט עם 6 עד 8 גיגה בייט זיכרון לעבודה חלקה, או אפילו מעבד רגיל אם עובדים עם גרסאות מכווצות כמו GGUF, AWQ או GPTQ שהיוצרים שחררו. טוענים אותו דרך transformers ישירות עם פונקציית apply_chat_template כדי לשמור על מבנה השיחה התקין.

אם כל מה שאתם צריכים זה לסכם מסמכים פנימיים בארגון בלי להוציא מידע החוצה, שווה להרים אותו לבד בעלות חומרה אפסית. לעומת זאת, אם יש לכם משימות ניתוח מסובכות בעברית או שאתם בונים צ'אט שמחייב היגיון מורכב, עדיף לקרוא ל־API של מודל ענק במקום להסתבך עם התוצרים של מודל כל כך קטן.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen1.5-1.8B-Chat")
print(pipe("שלום"))

הרישיון

הרישיון המדווח הוא other, כלומר רישיון מותאם אישית של הפרויקט ולא רישיון קוד פתוח סטנדרטי כמו MIT או אפאצ'י. מי שמתכנן לשלב אותו במוצר מסחרי חייב לקרוא את תנאי הרישיון המקוריים של Qwen כדי לוודא שאין הגבלות שימוש, דרישות תמלוגים או סייגים על מספר משתמשים.

הרישיון המלא בעמוד המודל ↗