GPT
Q

Qwen1.5-14B-Chat

קוד פתוח

Qwenother2024-01-30

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • chat

יש כאן גם סקירה על Qwen עצמו.

גרסת צ'אט של 14 מיליארד פרמטרים שמציעה חלון הקשר של 32 אלף טוקנים. היא יושבת בדיוק באמצע בין מודלים קלים שמוגבלים בהבנה לבין ענקים שדורשים שרת ייעודי.

  • 14Bפרמטרים
  • 32,768טוקנים בהקשר
  • 26.4 GBמשקל הקבצים
  • 13,053הורדות בחודש

מה זה

הגרסה הזו היא שלב בטא לקראת Qwen2, והיא נבנתה כמודל שיחה שעבר אימון נוסף בהתאמה להעדפות אנושיות לצד כוונון עדין. הדגש העיקרי כאן הוא תמיכה יציבה בחלון הקשר של 32 אלף טוקנים בלי צורך בטעינת קוד מותאם אישית מרחוק, מה שמפשט את השילוב בספריות סטנדרטיות.

מבחינת מבנה פנימי, היוצרים השמיטו בגרסת הבטא הזו מנגנונים כמו Group Query Attention וחלונות קשב נעים, שנשמרו לגדלים אחרים. עדיין מדובר במודל שמביא ביצועים טובים יותר בשיחה חופשית ורב לשונית בהשוואה לסדרת Qwen המקורית, עם טוקנייזר שאמור להתמודד טוב יותר עם שפות שונות וקוד.

מתאים ל

  • עיבוד מסמכים ארוכים

    הקשר של 32 אלף טוקנים מאפשר לנתח טקסטים רחבים בלי לקטוע את המידע.

  • עוזר שיחה וקוד

    המודל עבר התאמה לשיחה וכולל טוקנייזר שמותאם לשפות תכנות שונות.

  • פריסה מקומית בשרת

    משתלב ישירות בספריית transformers בלי צורך להריץ קוד לא מוכר.

איפה זה נופל

בכרטיס המודל מציינים בפירוש בעיות של החלפת שפות לא רצויה באמצע פלט, וממליצים להשתמש בהגדרות היפר פרמטרים מדויקות מקובץ התצורה כדי לנסות למנוע את זה. מעבר לזה, מדובר בגרסת בטא נטולת אופטימיזציות ארכיטקטורה כמו GQA, כך שצריכת הזיכרון שלו בזמן ריצה על הקשרים ארוכים תהיה כבדה בהרבה ממה שאפשר לצפות.

אותה משפחה

Qwen1.5 יצא ב־21 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

למה המודל זורק לי שגיאה כשאני מנסה לטעון אותו?

הארכיטקטורה דורשת גרסה מעודכנת של ספריית transformers. צריך להתקין גרסה 4.37.0 ומעלה כדי שהמערכת תזהה את סוג המודל.

האם אפשר להריץ אותו על מחשב אישי רגיל?

הקבצים שוקלים מעל 26 גיגה בייט ודורשים זיכרון גרפי כבד מאוד. כדי להריץ על חומרה ביתית עדיף לפנות לגרסאות מכווצות כמו AWQ או GGUF.

מה עושים אם המודל מתחיל לערבב שפות בתשובה?

היוצרים מודעים לבעיה וממליצים להשתמש בפרמטרי היצירה שנמצאים בקובץ generation config של המודל כדי לייצב את הפלט.

איך מריצים

כדי להעלות את משקלי ה־bfloat16 המקוריים, שתופסים מעל 26 גיגה בייט, תצטרכו כרטיס מסך חזק עם לפחות 32 גיגה בייט של זיכרון ייעודי. בנוסף, חובה לוודא שגרסת ספריית transformers היא לפחות 4.37.0, אחרת תקבלו שגיאה ישירות בטעינה.

אם אין לכם חומרה כזו, המפתחים מפנים לגרסאות מכווצות בפורמטים כמו AWQ, GPTQ או GGUF. אלה מאפשרות לדחוף את המודל לכרטיסים צרכניים פשוטים יותר בלי לאבד יותר מדי דיוק.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen1.5-14B-Chat")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ולא כרישיון קוד פתוח סטנדרטי כמו Apache או MIT. זה אומר שחובה לבדוק את תנאי השימוש הפרטניים של הפרויקט לפני שמשלבים אותו במוצר מסחרי, כי ייתכנו הגבלות על שימוש מסחרי או הפצה.

הרישיון המלא בעמוד המודל ↗