GPT
Q

Qwen1.5-72B-Chat-GPTQ-Int4

קוד פתוח

Qwenother2024-02-04

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • chat

יש כאן גם סקירה על Qwen עצמו.

גרסה מכווצת של מודל ענק עם 72 מיליארד פרמטרים. היא נועדה לתת יכולות שיחה כבדות בלי לחייב אשכול שרתים מנופח בשביל להריץ אותה.

  • 72Bפרמטרים
  • 32,768טוקנים בהקשר
  • 38.5 GBמשקל הקבצים
  • 7,943הורדות בחודש

מה זה

מדובר בגרסת בטא של סדרת Qwen2 שהוכשרה מראש על כמויות דאטה גדולות ועברה כיוונון ייעודי לשיחה עם בני אדם. המפתחים שילבו כאן אימון מבוסס משוב אנושי, מה שאמור להפוך את התשובות לטבעיות יותר בשיחה חופשית.

בגודל כזה של 72 מיליארד פרמטרים מקבלים מודל עם עומק משמעותי של שמונים שכבות ותמיכה רשמית בחלון של עד שלושים ושניים אלף טוקנים. היתרון הגדול של החבילה הזו הוא הכיווץ המובנה לארבעה ביטים, מה שחותך את נפח הקבצים ומאפשר לוותר על טעינת קוד צד שלישי לא מוכר בספריית transformers.

מתאים ל

  • בוטים לשיחות מורכבות

    המודל עבר אופטימיזציה ייעודית להעדפות אנושיות בצ'אט ומפיק תשובות טבעיות יותר.

  • ניתוח מסמכים ארוכים

    תמיכה מובנית בחלון הקשר של 32 אלף טוקנים מתאימה לקריאה של טקסטים רחבים.

  • אירוח עצמי במשאבים מוגבלים

    הכימוס לארבעה ביטים מאפשר להריץ מודל 72B בחצי מדרישת הזיכרון המקורית.

איפה זה נופל

המפתחים מודים בפירוש שהשימוש בשיטת DPO שיפר את חוויית השיחה מול אנשים, אבל פגע בביצועים במבחנים ובנצ'מרקים מקובלים. בנוסף, גרסת הבטא הזו לא כוללת מנגנונים כמו GQA או שילוב של sliding window attention. קיימת גם תופעה ידועה של מעבר לא רצוי בין שפות בזמן הפקה, ובמקרה כזה היוצרים מפנים להגדרות ה־generation_config שלהם.

אותה משפחה

Qwen1.5 יצא ב־21 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איזו גרסת תוכנה צריך בשביל להריץ אותו?

חובה להתקין transformers מגרסה 4.37.0 ומעלה. אם תנסו לטעון אותו בגרסה ישנה יותר, תקבלו שגיאת KeyError על סוג המודל.

האם המודל מתאים למשימות קוד או לוגיקה נוקשה?

הכרטיס מצהיר שהאימון פגע בציוני המבחנים לטובת חוויית שיחה. אם אתם צריכים דיוק מתמטי או היצמדות מחמירה לבנצ'מרקים, כדאי לבדוק אותו בזהירות לפני שמתחייבים.

איך מריצים

המשקל יושב על קצת יותר מ־38 גיגה בייט, מה שאומר שחובה כרטיס מסך מקצועי או שילוב של שני כרטיסים צרכניים חזקים כדי להחזיק את כל המשקלים בזיכרון ה־VRAM. בנוסף, חובה לוודא שמותקנת גרסת transformers 4.37.0 ומעלה, אחרת הספרייה פשוט תיכשל בזיהוי הארכיטקטורה.

אם אין לכם כרטיסים ייעודיים עם מספיק זיכרון זמין, חבל להסתבך עם פריסה מקומית. במצב כזה עדיף לצרוך מודלים דרך שירות ענן חיצוני במקום להתעסק בניהול החומרה בעצמכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen1.5-72B-Chat-GPTQ-Int4")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר בתור other. זה אומר שלא מדובר ברישיון קוד פתוח מוכר וסטנדרטי כמו MIT או Apache, וחובה לגשת ישירות לתנאי הרישיון המקוריים של היוצרים כדי להבין האם ואיך מותר להשתמש בו לצרכים מסחריים.

הרישיון המלא בעמוד המודל ↗