GPT
Q

Qwen1.5-4B-Chat

קוד פתוח

Qwenother2024-01-30

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • chat

יש כאן גם סקירה על Qwen עצמו.

גרסת צ'אט קומפקטית שנועדה למכשירים מקומיים, עם תמיכה בהקשר של 32,768 טוקנים. היא מיועדת למי שצריך מודל שיחה עצמאי בלי לגרור שרתי ענק.

  • 4Bפרמטרים
  • 32,768טוקנים בהקשר
  • 7.4 GBמשקל הקבצים
  • 15,521הורדות בחודש

מה זה

מדובר בגרסת בטא שמקדימה את סדרת Qwen2, הכוללת קרוב לארבעה מיליארד פרמטרים ומגיעה מאומנת מראש ומכווננת לשיחה באמצעות משוב אנושי. הגודל הזה יושב בדיוק בין מודלי הצעצוע הקטנים לבין מודלי ה־7B הכבדים יותר, ומאפשר להריץ שיחות ארוכות תודות לתמיכה מלאה בהקשר של 32 אלף טוקנים.

המבנה הפנימי נשען על ארכיטקטורת שנאים עם שילוב של SwiGLU, אך בגרסת הבטא הזו המפתחים מציינים כי טרם הוטמעו מנגנוני קשב מתקדמים כמו GQA או שילוב של חלונות קשב נעים, ששמורים כרגע רק לגרסאות הגדולות יותר.

מתאים ל

  • עוזר שיחה מקומי

    משקל קל של 7.4 גיגה מאפשר הרצה ישירה על מחשבי פיתוח ומכשירים מקומיים בלי תלות ברשת.

  • עיבוד מסמכים ארוכים

    חלון הקשר של 32K טוקנים מתאים לניתוח טקסטים גדולים באנגלית במסגרת מודל קטן.

  • אינטגרציה ללא קוד חיצוני

    אין צורך בהרצת קוד מרוחק בעת הטעינה, מה שמקל על שילוב מאובטח בסביבות עבודה קיימות.

איפה זה נופל

היוצרים מתריעים במפורש על בעיה של ערבוב שפות לא רצוי באמצע שיחה, וממליצים להשתמש בהגדרות הדגימה המקוריות כדי למתן אותה. בנוסף, רשימת השפות המדווחת כוללת אנגלית בלבד, ולכן אין להסתמך עליו למשימות מורכבות בעברית. היעדר מנגנון GQA בגודל הזה אומר גם שצריכת הזיכרון בזמן שימוש בכל 32 אלף הטוקנים תהיה כבדה במיוחד.

אותה משפחה

Qwen1.5 יצא ב־21 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

למה מופיעה שגיאת KeyError qwen2 בזמן הטעינה?

הקוד של המודל נתמך רק מגרסת transformers 4.37.0 ומעלה. שדרוג של הספרייה יפתור את הבעיה מיד ויאפשר טעינה רגילה.

מה אפשר לעשות אם המודל מתחיל לערבב שפות?

המפתחים מציעים להגדיר את הפרמטרים של תהליך היצירה בדיוק לפי הקובץ המקורי שמגיע איתו כדי למנוע את התופעה.

איך מריצים

המשקל הכולל של הקבצים עומד על 7.4 גיגה בייט בפורמט bfloat16, כך שכרטיס מסך פשוט עם 8 עד 10 גיגה זיכרון יספיק כדי לטעון אותו ישירות. מי שמעדיף לחסוך במשאבים יכול לפנות לגרסאות מכומתות כמו GPTQ, AWQ או GGUF שמקטינות את צריכת הזיכרון ומאפשרות הרצה גם על מחשבים ניידים ומעבדים רגילים.

חובה לעבוד עם ספריית transformers מגרסה 4.37.0 ומעלה כדי לא לקבל שגיאה בזיהוי הארכיטקטורה. אם אתם צריכים תפוקה מהירה למספר משתמשים במקביל והקשר ארוך במיוחד, שירות ענן חיצוני עשוי להיות יעיל יותר מלהחזיק חומרה ייעודית.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen1.5-4B-Chat")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר תחת סיווג כללי ולא ברישיון קוד פתוח סטנדרטי. כדי לדעת אם מותר לשלב אותו במוצר מסחרי, יש לבדוק את תנאי השימוש המדויקים שהמפתחים צירפו לקבצים לפני ההפצה.

הרישיון המלא בעמוד המודל ↗