GPT
Q

Qwen2.5-72B-Instruct

קוד פתוח

Qwenother2024-09-16

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • chat

יש כאן גם סקירה על Qwen עצמו.

מודל הוראות כבד שמתחרה בקוד פתוח עם המובילים בתחום, במיוחד אם אתם צריכים דיוק במתמטיקה, בקוד או בהפקת מבני JSON מורכבים.

  • 73Bפרמטרים
  • 32,768טוקנים בהקשר
  • 135 GBמשקל הקבצים
  • 440,609הורדות בחודש

מה זה

מדובר במודל הדגל בסדרת הקוד הפתוח של המפתחים, עם קרוב ל־73 מיליארד פרמטרים שדורשים תשתית רצינית. הוא נבנה כדי לתת מענה ממוקד במקומות שבהם מודלים פתוחים נוטים להישבר: מעקב מדויק אחרי הוראות מערכת מורכבות, הבנת נתונים טבלאיים וכתיבת קוד.

הוא מסוגל לפלוט עד 8,192 טוקנים ברצף, מה שמתאים למשימות פיתוח וייצור מסמכים ארוכים. התמיכה שלו מקיפה מעל 29 שפות, כולל ערבית, אנגלית ושפות אירופיות ואסיאתיות רבות, אם כי עברית אינה מוזכרת במפורש ברשימה הזו ודורשת בדיקה עצמאית לפני שמסתמכים עליה.

מתאים ל

  • ייצור פלטי JSON

    הוא אומן לעקוב בקפדנות אחרי מבני נתונים ולהחזיר קוד JSON תקין ישירות מתוך טקסטים וטבלאות.

  • פתרון בעיות מתמטיקה וקוד

    הוא כולל שיפורים ייעודיים שנבנו מול מודלים מומחים כדי לספק דיוק גבוה בלוגיקה ובפיתוח תוכנה.

  • סוכני שיחה מותאמים

    הוא שומר על עקביות גבוהה מול פרומפטים מורכבים והנחיות תפקיד מגוונות.

איפה זה נופל

הבעיה המרכזית בהרצה מקומית היא הקונטקסט הארוך. כדי לחצות את רף 32 אלף הטוקנים נדרשת התערבות ידנית בקובץ ההגדרות, וכאשר מריצים את זה עם כלי שרת נפוצים כמו vLLM, מנגנון ההרחבה נשאר קבוע ועלול לקלקל את התוצאות דווקא בשאילתות קצרות ופשוטות. בנוסף, למרות התמיכה הרחבה בשפות, עברית לא נכללת ברשימת השפות הנתמכות רשמית בכרטיס המודל.

אותה משפחה

Qwen2.5 יצא ב־29 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך אפשר לנצל את כל חלון ההקשר עד 128 אלף טוקנים?

הקובץ מגיע מוגדר ל־32,768 טוקנים בלבד. כדי להרחיב אותו מעבר לכך צריך להוסיף ידנית הגדרות מתיחה לקובץ הקונפיגורציה, אך קחו בחשבון שזה עשוי לפגוע באיכות המענה בטקסטים קצרים.

האם הוא מתאים לשימוש מסחרי חופשי?

הרישיון המדווח אינו רישיון פתוח רגיל אלא רישיון פרטי. אתם חייבים לקרוא את מסמך הרישיון המקורי כדי לדעת אם מותר לשלב אותו במערכת מסחרית בלי תשלום או דיווח.

איך מריצים

במשקל של 135 גיגה בבייט בפורמט המקורי שלו, לא מריצים אותו על מחשב אישי או שרת מזדמן. תצטרכו שרת עם מספר מאיצים גרפיים חזקים כדי להחזיק אותו בזיכרון, או לעבוד עם קוונטיזציה שתקטין את הנפח על חשבון חלק מהדיוק. הקוד מחייב גרסה עדכנית של ספריית transformers כדי לא להיתקל בשגיאות טעינה של הארכיטקטורה.

בברירת המחדל שלו הוא מוגדר לטפל ב־32,768 טוקנים. אם תרצו למתוח אותו לעבר 128 אלף טוקנים תצטרכו להפעיל הרחבת YaRN ידנית בקונפיגורציה, אבל המפתחים מזהירים ששימוש סטטי בה בתוך vLLM עלול לפגוע בביצועים של טקסטים קצרים.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen2.5-72B-Instruct")
print(pipe("שלום"))

הקבצים

47 קבצים במאגר, 135 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כמותאם אישית ולא כרישיון קוד פתוח סטנדרטי. המשמעות היא שחובה לפתוח את תנאי השימוש המדויקים שהוצמדו למודל לפני שמשלבים אותו במוצר מסחרי, כדי לוודא שאין בו מגבלות על נפח משתמשים חודשי או איסורים על תחומי פעילות מסוימים.

הרישיון המלא בעמוד המודל ↗