GPT
Q

Qwen2.5-14B-Instruct

קוד פתוח

Qwenapache-2.02024-09-16

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • chat

יש כאן גם סקירה על Qwen עצמו.

גרסת הוראות בינונית שפוגעת בדיוק בנקודה שבין ביצועים חזקים בקוד ומתמטיקה לבין דרישות חומרה הגיוניות. פתרון טוב למי שרוצה עצמאות בלי להחזיק שרתים מפלצתיים.

  • 15Bפרמטרים
  • 32,768טוקנים בהקשר
  • 27.5 GBמשקל הקבצים
  • 2,709,565הורדות בחודש

מה זה

מדובר במודל של כמעט 15 מיליארד פרמטרים שמכוון למשימות מורכבות יותר ממודלי ה־7B הרגילים, אבל בלי המשקל הכבד של גרסאות ה־72B. לפי המפתחים, הושם כאן דגש חזק על כתיבת קוד, פתרון בעיות מתמטיות, מעקב מדויק אחרי הנחיות מערכת ויצירה של פלט מובנה כמו טבלאות וקובצי JSON.

הוא מסוגל לפלוט טקסטים ארוכים של עד 8,192 טוקנים, ותומך ביותר מ־29 שפות, כולל ערבית, רוסית, ספרדית וצרפתית. השילוב הזה הופך אותו למועמד טבעי למשימות עיבוד נתונים אוטומטיות שדורשות אמינות במבנה התשובה ולא רק טקסט חופשי.

מתאים ל

  • חילוץ נתונים ל־JSON

    הוא אומן להחזיר מבנים מוגדרים ולעקוב באדיקות אחרי תבניות, מה שמתאים לניתוח מסמכים.

  • בוטים מבוססי תפקיד

    העמידות הגבוהה שלו לשינויים בהנחיות מערכת עוזרת לו לשמור על אופי והגדרות מורכבות.

  • סיוע בכתיבת קוד

    התמחות ממוקדת במתמטיקה ותכנות מאפשרת לו לבצע משימות סקריפטים ובדיקות קוד ברמה גבוהה.

איפה זה נופל

ברירת המחדל של הקונפיגורציה מוגבלת ל־32,768 טוקנים. אפשר להרחיב את ההקשר עד 131,072 טוקנים באמצעות מנגנון YaRN, אבל המפתחים מזהירים מראש ששימוש ב־vLLM עם הגדרה זו עלול לפגוע בביצועים ובאיכות התשובות בטקסטים קצרים. בנוסף, עברית לא מוזכרת ברשימת השפות שנתמכות רשמית, כך שחובה לבדוק היטב את איכות הפלט והטוקניזציה אם אתם בונים על שימוש מקומי.

אותה משפחה

Qwen2.5 יצא ב־29 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם כדאי להפעיל את הרחבת ההקשר ל־128K מיד בהתחלה?

לא. המפתחים ממליצים להוסיף את הגדרת YaRN רק אם יש צורך ממשי בטקסטים ארוכים במיוחד. מכיוון שכרגע התמיכה ב־vLLM סטטית, הפעלת ההרחבה עלולה להוריד את איכות המודל במשימות שוטפות עם טקסטים קצרים.

איזו גרסת transformers מינימלית נדרשת להרצה?

חובה לעבוד עם transformers בגרסה 4.37.0 לפחות. גרסאות ישנות יותר לא יזהו את הארכיטקטורה ויזרקו שגיאת KeyError על qwen2.

איך מריצים

המשקל הגולמי של הקבצים עומד על 27.5 גיגה בפורמט bfloat16. כדי להריץ אותו כמו שהוא בלי קוונטיזציה תצטרכו כרטיס מסך חזק עם לפחות 32 או 40 גיגה זיכרון גרפי, אחרת תיאלצו לפצל אותו בין כמה כרטיסים או להשתמש בגרסאות מכווצות.

ההרצה המומלצת היא דרך vLLM או ספריית transformers בגרסה 4.37.0 ומעלה כדי לא להיתקל בשגיאות טעינה. אם מדובר בפרויקט קטן, בניסוי ראשוני או שאין לכם חומרה כזו פנויה, החזקת שרת ייעודי כזה תעלה לא מעט ועדיף להשתמש ב־API חיצוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen2.5-14B-Instruct")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והמשקלים והפצה בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗