GPT
Q

Qwen1.5-32B-Chat

קוד פתוח

Qwenother2024-04-03

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • chat

יש כאן גם סקירה על Qwen עצמו.

גרסת צ'אט של 32 מיליארד פרמטרים שמציעה פשרה טובה בין מודלים ענקיים לקלים. היא מגיעה מאומנת להעדפות אנושיות וכוללת חלון הקשר יציב באורך מלא.

  • 33Bפרמטרים
  • 32,768טוקנים בהקשר
  • 60.6 GBמשקל הקבצים
  • 49,496הורדות בחודש

מה זה

המודל הזה משמש גרסת בטא לקראת Qwen2, ומביא ארכיטקטורה דחוסה של 64 שכבות. בניגוד לרוב הגרסאות הקטנות יותר בסדרה שלו, דווקא כאן בחרו להטמיע מנגנון של Group Query Attention, מה שמייעל את פעולת הקשב בזמן הריצה. הוא עבר אימון מקדים על היקף נתונים נרחב, ואחריו כוונון עדין מונחה לצד אופטימיזציה ישירה להעדפות אנושיות כדי להתאים אותו לשיחות.

הוא מספק חלון הקשר של 32,768 טוקנים ומשתמש בטוקנייזר שאמור להתמודד עם שפות שונות וקוד תכנות. הקוד שלו כבר נתמך ישירות בספריית transformers בלי צורך לאשר הרצת קוד מרוחק, מה שמקל על ההטמעה בתשתיות קיימות ומצמצם סיכוני אבטחה בסיסיים.

מתאים ל

  • בוט שיחה חכם

    עבר כוונון ייעודי להעדפות אנושיות ויודע לנהל דיאלוג רציף ומורכב.

  • ניתוח מסמכים ארוכים

    חלון הקשר של 32 אלף טוקנים מאפשר לטעון טקסטים כבדים בבת אחת.

  • סיוע בכתיבת קוד

    הטוקנייזר והאימון מותאמים לקוד, עם ארכיטקטורה שמספקת עומק ללוגיקה.

איפה זה נופל

הכרטיס מזהיר במפורש מבעיות של ערבוב שפות, מצב שבו המודל מחליף שפה באמצע תשובה בלי סיבה נראית לעין. כדי להתמודד עם זה, היוצרים ממליצים להיצמד בדיוק לפרמטרי היצירה שהם הגדירו בקובץ התצורה. בנוסף, חלון הקשר מלא של 32 אלף טוקנים על מודל בגודל כזה ידרוש כמות עצומה של זיכרון בפועל, כך שחובה לבדוק את התנהגות המערכת תחת עומס אמיתי לפני שבונים עליו.

אותה משפחה

Qwen1.5 יצא ב־21 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

למה אני מקבל שגיאת KeyError בהרצה?

המודל דורש גרסת transformers מודרנית מ־4.37.0 ומעלה כדי לזהות את ארכיטקטורת qwen2. שדרוג פשוט של החבילה בסביבת העבודה שלכם יפתור את הבעיה.

האם הוא תומך בעברית בצורה טובה?

המפתחים מציינים תמיכה בריבוי שפות, אך מזהירים מתופעות של ערבוב שפות במהלך הפלט. שפת המקור העיקרית המוצהרת היא אנגלית, ולכן צריך לבדוק אותו בקפידה על טקסטים בעברית.

איך מריצים

במשקל של מעל 60 גיגה בייט בדיוק bfloat16, תשכחו מלהריץ אותו על מחשב ביתי רגיל. תצטרכו לפחות שני כרטיסי מסך חזקים עם 24 גיגה זיכרון וידאו כל אחד כדי להעלות אותו, או לפנות לשרת ייעודי עם A100 או H100 אם אתם מתכננים לנצל את מלוא חלון ההקשר.

אם אין לכם חומרה כזו זמינה באופן קבוע, הקמה ותחזוקה של שרת כזה תעלה לא מעט. במקרים של עומס עבודה נמוך או ניסויים ראשוניים, עדיף להשתמש בנקודת קצה מנוהלת דרך ספק ענן במקום להחזיק תשתית כבדה דולקת.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen1.5-32B-Chat")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ולא כרישיון קוד פתוח סטנדרטי. זה אומר שחובה לקרוא את קובץ התנאים המקורי שמצורף למאגר לפני כל שימוש, בעיקר אם אתם מתכננים לשלב אותו במוצר מסחרי. אל תניחו שמותר להפיץ אותו או למכור גישה אליו בלי לוודא את ההגבלות של היוצרים.

הרישיון המלא בעמוד המודל ↗