GPT
Q

Qwen1.5-72B-Chat

קוד פתוח

Qwenother2024-01-30

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • chat

יש כאן גם סקירה על Qwen עצמו.

גרסת שיחה בקנה מידה של 72 מיליארד פרמטרים שמתאימה למי שחייב מודל פתוח חזק במיוחד. הוא מציע חלון הקשר של 32 אלף טוקנים ולא דורש הרצת קוד מרוחק.

  • 72Bפרמטרים
  • 32,768טוקנים בהקשר
  • 135 GBמשקל הקבצים
  • 10,685הורדות בחודש

מה זה

מדובר במודל הדגל הצפוף בסדרת הבטא של Qwen2. הוא עבר אימון מקדים על היקף נתונים רחב, ואחריו כוונון עדין ואופטימיזציית העדפות אנושיות מסוג DPO כדי לתפקד כצ'אט. המבנה שלו נשען על ארכיטקטורת רשת קלאסית עם אקטיבציית SwiGLU והטיה בחישובי תשומת הלב.

בגרסה הזו צוות הפיתוח ויתר זמנית על מנגנוני GQA וחלונות תשומת לב מחליקים בדגם ה־72B. המשמעות היא חישוב תשומת לב מלא לכל אורך 32,768 הטוקנים, מה שדורש כוח עיבוד אמיתי אבל שומר על יציבות. בניגוד לגרסאות קודמות של המשפחה, הקוד שלו נתמך ישירות בספריית transformers החל מגרסה 4.37.0 ולכן לא צריך לאשר הרצת קוד צד שלישי בעת הטעינה.

מתאים ל

  • עיבוד מסמכים ארוכים

    חלון של 32K טוקנים ותשומת לב מלאה מתאימים לקריאה ותמצות של קבצים מורכבים בלי לאבד פרטים.

  • בוט שיחה באנגלית וקוד

    אימון DPO נרחב הופך אותו למתאים למענה מפורט הדורש שמירה הדוקה על כוונת המשתמש.

  • הסבת מודל לקוונטיזציה

    נקודת מוצא מלאה ב־bfloat16 למי שרוצה לייצר בעצמו משקלי AWQ או GGUF לפי דרישות המערכת שלו.

איפה זה נופל

היוצרים מודים בעצמם שהמודל סובל מבעיות של החלפת שפות באמצע משפט וממקרים של פלט לא רצוי. ההמלצה הרשמית שלהם היא להיצמד להגדרות הריצה המדויקות בקובץ ברירת המחדל כדי לצמצם את זה. בנוסף, מדובר בגרסת בטא ללא אופטימיזציית GQA, כך שצריכת הזיכרון שלו בזמן ריצה כבדה מאוד.

אותה משפחה

Qwen1.5 יצא ב־21 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

למה מופיעה שגיאת KeyError qwen2 בטעינה?

הספרייה שלכם ישנה מדי. צריך לעדכן את transformers לגרסה 4.37.0 ומעלה שכוללת תמיכה מובנית בארכיטקטורה של המודל.

מה עושים אם המודל מתחיל להחליף שפות באמצע התשובה?

היוצרים ממליצים להשתמש במדויק בפרמטרים של generation_config.json שמצורף לפרויקט כדי לייצב את הפלט.

האם כדאי להריץ אותו ללא כיול על שרת יחיד?

לא. הקבצים שוקלים 135 גיגה בייט ודורשים לפחות שני כרטיסי מסך מתקדמים של 80 גיגה בייט כדי לטעון אותם בכלל.

איך מריצים

המשקל המקורי של המודל בדיוק bfloat16 תופס 135 גיגה בייט ומחולק ל־48 קבצים. כדי להרים אותו מקומית בלי קוונטיזציה תצטרכו שרת עם לפחות שני כרטיסי A100 או H100 של 80 גיגה בייט רק כדי להחזיק את המשקלים בזיכרון, עוד לפני שחישבתם את זיכרון ההקשר.

אם אין לכם חומרה ייעודית כזו, אין טעם לנסות להריץ את הגרסה הגולמית הזו על שרת בודד. עדיף לפנות לגרסאות המכווצות שהמפתחים מציינים, כמו AWQ, GPTQ או GGUF, או להשתמש בספק שמגיש אותו דרך API.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen1.5-72B-Chat")
print(pipe("שלום"))

הקבצים

48 קבצים במאגר, 135 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other ולא כרישיון קוד פתוח סטנדרטי כמו Apache או MIT. המשמעות היא שיש תנאים וסייגים ספציפיים שהמפרסם קבע. לפני שמשלבים אותו במוצר מסחרי, חובה לקרוא את קובץ הרישיון המקורי ולבדוק את ההגבלות העסקיות.

הרישיון המלא בעמוד המודל ↗