GPT
Q

Qwen-72B

קוד פתוח

Qwenother2023-11-26

  • transformers
  • safetensors
  • qwen
  • text-generation
  • custom_code

יש כאן גם סקירה על Qwen עצמו.

מודל בסיס פתוח של עליבאבא עם 72 מיליארד פרמטרים שמתאים למי שמחפש חלופה חזקה ל־LLaMA2, במיוחד במשימות מתמטיקה, קוד ושפות שאינן רק אנגלית.

  • 72Bפרמטרים
  • 32,768טוקנים בהקשר
  • 135 GBמשקל הקבצים
  • 3,784,922הורדות בחודש

מה זה

מדובר במודל שפה שאומן על יותר מ־3 טריליון טוקנים, כולל טקסט מאתרי אינטרנט, ספרים וקוד. הוא נשען על חלון הקשר של 32,768 טוקנים ומשתמש בארכיטקטורה של 80 שכבות עם RoPE, SwiGLU ו־RMSNorm. אחד המאפיינים הבולטים שלו הוא מילון מורחב של מעל 150 אלף טוקנים המבוסס על tiktoken, שמייעל את הדחיסה והעיבוד של שפות רבות כולל עברית.

במבחני ביצועים הוא עוקף את LLaMA2-70B בכל המדדים שנבדקו בכרטיס המודל. במתמטיקה הוא מציג זינוק משמעותי עם ציון של 35.2 במבחן MATH לעומת 12.0 של המתחרה מבית מטא, ובמבחן HumanEval לכתיבת קוד הוא מגיע ל־35.4 לעומת 26.2. היכולות האלו הופכות אותו לבסיס חזק במיוחד למי שרוצה לאמן מודל משלו על נתונים פנימיים.

מתאים ל

  • אימון מודל פנימי לארגון

    מתאים לחברות שרוצות מודל בסיס פתוח חזק עם 72 מיליארד פרמטרים כדי לבצע כוונון עדין על מידע פרטי.

  • ייצור קוד ופתרון בעיות

    התוצאות שלו במבחני HumanEval ו־MATH הופכות אותו לבסיס יעיל למערכות שמנתחות ומייצרות קוד.

  • עיבוד מסמכים ארוכים

    תמיכה בחלון הקשר של 32k טוקנים מאפשרת לקרוא קבצים כבדים ונתונים טכניים ברצף אחד.

איפה זה נופל

זהו מודל בסיס שנועד להשלמת טקסט ולא עבר אימון עם משוב אנושי או התאמה לשיחה, כך שהוא לא יענה כמו צ'אטבוט אלא ימשיך את הפרומפט שקיבל. אם אתם מחפשים מענה ישיר לשאלות או עוזר אישי, תצטרכו לאמן אותו בעצמכם או להשתמש בגרסת הצ'אט הנפרדת. בנוסף, חלוקת המספרים לתווים בודדים במילון והשונות של הטוקנייזר מול ספריות נפוצות דורשות התייחסות מיוחדת לטוקנים מיוחדים בזמן כוונון עדין.

אותה משפחה

Qwen יצא ב־9 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב פיתוח רגיל?

לא. משקל הקבצים הוא 135 גיגה־בייט והרצה בסיסית דורשת לפחות שני כרטיסי A100 של 80 גיגה כדי להגיע לנפח הזיכרון הדרוש. גם בגרסה מכומתת של 4 ביט תצטרכו לפחות 48 גיגה זיכרון גרפי.

האם אפשר להשתמש בו במוצר מסחרי בחינם?

המודל תומך בשימוש מסחרי, אך הוא כפוף לתנאי הרישיון של עליבאבא. לפני הפצה של מוצר מסחרי מבוסס עליו אתם נדרשים למלא טופס בקשה ולקבל אישור.

איך מריצים

המשקל הגולמי של הקבצים מגיע ל־135 גיגה־בייט, כך שהרצה מקומית דורשת משאבים כבדים. להרצה בפורמט המקורי של BF16 או FP16 תצטרכו לפחות 144 גיגה־בייט זיכרון גרפי, כלומר שרתי GPU עם לפחות שני כרטיסי A100 של 80GB או חמישה כרטיסי V100 של 32GB. אם תמירו אותו לכימות של Int4, עדיין תידרשו ל־48 גיגה־בייט זיכרון מסך, שזה לפחות כרטיס A100 בודד או שני כרטיסי V100.

ההרצה מתבצעת בסביבת פייתון 3.8 ומעלה באמצעות ספריית transformers של Hugging Face, ומומלץ להתקין את ספריית flash-attention כדי לצמצם צריכת זיכרון ולהאיץ את העבודה. אם אין לכם גישה למערך שרתים כזה, אין טעם לנסות להרים אותו על מחשב מקומי, ועדיף להשתמש ב־API מנוהל.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen-72B")
print(pipe("שלום"))

הקבצים

103 קבצים במאגר, 135 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כמותאם אישית של עליבאבא. הקוד ומשקלי המודל פתוחים לחלוטין לצרכי מחקר אקדמי ומאפשרים שימוש מסחרי, אך שימוש מסחרי מותנה במילוי טופס בקשה רשמי באתר החברה לפני ההטמעה במוצר פעיל.

הרישיון המלא בעמוד המודל ↗