GPT
Q

Qwen1.5-72B

קוד פתוח

Qwenother2024-01-23

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • pretrained

יש כאן גם סקירה על Qwen עצמו.

גרסת בסיס כבדה של 72 מיליארד פרמטרים שמיועדת לאימון המשך או כוונון עצמאי. מקבלים כאן חלון הקשר של 32 אלף טוקנים בלי צורך בהרצת קוד חיצוני.

  • 72Bפרמטרים
  • 32,768טוקנים בהקשר
  • 135 GBמשקל הקבצים
  • 10,158הורדות בחודש

מה זה

מדובר במודל בסיס פתוח שמתפקד כגרסת בטא לקראת Qwen2, ונבנה על ארכיטקטורת שנאי מסוג מפנח בלבד עם 80 שכבות. הוא אומן על נפח מידע גדול ותומך בריבוי שפות ובקוד, לצד חלון הקשר יציב שמגיע ל־32,768 טוקנים. השינוי הטכני הבולט מול הגרסה הקודמת הוא התמיכה המובנית בספריית transformers הרגילה, כך שלא צריך לסמן אישור להרצת קוד חיצוני שעלול להוות סיכון אבטחה בעת הטעינה.

בגודל הזה לא שילבו הפעם מנגנוני אופטימיזציה כמו group query attention או שילוב של sliding window attention, שנשארו בחוץ בגרסת הבטא הנוכחית של ה־72B. המודל שומר על ארכיטקטורה ישירה עם אקטיבציית SwiGLU והטיה בחישובי הקשב. הוא מיועד למי שמחפש משקל גולמי כבד כדי לבנות עליו שכבות משלו, ולא למי שמחפש מודל מוכן לשיחה שעונה ישירות לפרומפטים של משתמשי קצה.

מתאים ל

  • אימון מודל הוראות פנימי

    נקודת מוצא חזקה בגודל מלא עבור ארגונים שמבצעים SFT על דאטה פנימי שלהם.

  • המשך אימון על שפה חדשה

    בסיס רחב עם טוקנייזר מותאם שמאפשר המשך אימון על קורפוס ייעודי או טכני.

  • מחקר והשוואת ארכיטקטורות

    בדיקת ביצועי מודל 72B צפוף לפני ואחרי כוונון מול גרסאות עם מנגנוני קשב חסכוניים.

איפה זה נופל

היוצרים כותבים בפירוש בכרטיס המודל שהם לא ממליצים להשתמש במודל הבסיס הזה ישירות למשימות ייצור טקסט. בלי שעבר אימון המשך כמו SFT או RLHF, הוא פשוט ישלים מילים במקום לענות לשאלות, ולכן הוא לא מתאים כפתרון שיחה מהקופסה. בנוסף, גרסת הבטא של גודל 72B לא כוללת GQA, מה שמכביד משמעותית על צריכת הזיכרון בהקשרים ארוכים בהשוואה למודלים מודרניים אחרים.

אותה משפחה

Qwen1.5 יצא ב־21 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אפשר להשתמש במודל ישירות כצ'אטבוט?

לא, המפתחים מבהירים במפורש שזהו מודל בסיס שלא מיועד למענה ישיר. הוא ישלים משפטים במקום לנהל שיחה, וצריך לעבור תהליך כוונון ייעודי לפני שיוכל לתפקד כעוזר.

איזו גרסת תוכנה נדרשת כדי לטעון אותו?

חובה לעבוד עם ספריית transformers בגרסה 4.37.0 לפחות. גרסאות ישנות יותר לא יזהו את ארכיטקטורת qwen2 ויזרקו שגיאת מפתח.

איך מריצים

כדי להריץ מודל ששוקל 135 ג'יגה בייט בדיוק של bfloat16, דרושה חומרת שרתים רצינית מאוד. תצטרכו מערך של כמה מעבדים גרפיים חזקים כדי לטעון 48 קבצים לזיכרון הווידאו, או לבצע קוונטיזציה כבדה שעלולה לפגוע בדיוק.

ברמת התוכנה חובה לוודא שמותקנת גרסת transformers 4.37.0 ומעלה, אחרת מקבלים שגיאת KeyError על הארכיטקטורה. אם אין לכם אשכול שרתים ייעודי ומנוהל, הרמה עצמאית של מפלצת כזו תעלה הון בתשתיות ענן, וברוב המקרים עדיף לפנות ל־API חיצוני שמגיש אותו.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen1.5-72B")
print(pipe("שלום"))

הקבצים

48 קבצים במאגר, 135 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other בלבד, ולא כרישיון קוד פתוח סטנדרטי כמו MIT או אפאצ'י. המשמעות היא שחובה לבדוק את תנאי השימוש הספציפיים באתר הפרויקט או במאגר כדי להבין האם קיימות מגבלות מסחריות, מגבלות על כמות משתמשים חודשית, או תנאים מיוחדים לפני שמשלבים אותו במוצר.

הרישיון המלא בעמוד המודל ↗