GPT
Q

Qwen2.5-3B-Instruct

קוד פתוח

Qwenother2024-09-17

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • chat

יש כאן גם סקירה על Qwen עצמו.

גרסת הוראות קומפקטית שמביאה יכולות קוד, מתמטיקה ופליטת JSON למכשירים מקומיים. הוא שוקל פחות משישה גיגהבייט ומתאים למי שרוצה ביצועים טובים בלי להחזיק שרת יקר.

  • 3.1Bפרמטרים
  • 32,768טוקנים בהקשר
  • 5.8 GBמשקל הקבצים
  • 5,973,026הורדות בחודש

מה זה

במשקל של 3.1 מיליארד פרמטרים, הדגם הזה מיועד למשימות מוגדרות היטב שצריכות לרוץ מהר ומקומי. הסדרה הזו שמה דגש על שיפור בהבנת קוד ומתמטיקה מול הגרסאות הקודמות שלהם, לצד יכולת טובה יותר לעקוב אחרי הוראות מורכבות, להתמודד עם טבלאות ולפלוט מבני נתונים כמו JSON בלי להישבר.

הוא מגיע מכוונן להוראות ומציע חלון הקשר של 32,768 טוקנים עם יכולת לייצר עד 8,192 טוקנים ברצף. בגודל הזה, היכולת להחזיק הקשר ארוך יחסית ולשמור על דיוק במבנה התשובה היא מה שמבדיל אותו מדגמים קטנים אחרים, שנוטים להתפזר כשהפרומפט נהיה ארוך או טכני מדי.

מתאים ל

  • חילוץ מידע ל־JSON

    הדגם אומן לפלוט מבנים מוגדרים ולנתח טבלאות, מה שמתאים לעיבוד מסמכים אוטומטי.

  • בוט מקומי על חומרה צנועה

    הוא נכנס בכרטיסי מסך קטנים ומאפשר לנהל שיחות עם עמידות טובה להוראות מערכת.

  • עוזר קוד למשימות נקודתיות

    מתאים להשלמת פונקציות, בדיקות יחידה ותיקוני תחביר בלי להוציא קוד החוצה לרשת.

איפה זה נופל

למרות השדרוג ביכולות ההיגיון והקוד, מדובר עדיין בדגם של 3 מיליארד פרמטרים. הוא לא יחליף מודלים ענקיים במשימות שמצריכות ידע כללי עמוק מאוד, הסקת מסקנות רב שלבית מפותלת, או כתיבת קוד למערכות שלמות מאפס. בנוסף, חלון ההקשר המלא שלו מוגדר ל־32,768 טוקנים בלבד, בניגוד לחלק מהגרסאות הגדולות בסדרה שתומכות בעד 128K טוקנים.

אותה משפחה

Qwen2.5 יצא ב־29 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איזה כרטיס מסך צריך בשביל להריץ אותו כמו שצריך?

הקבצים שוקלים 5.8 גיגהבייט ב־bfloat16. כרטיס מסך עם 8 גיגהבייט זיכרון יספיק להרצה בסיסית, אבל לשימוש במלוא חלון ההקשר של 32 אלף טוקנים עדיף כרטיס עם 12 או 16 גיגהבייט כדי לא לחנוק את הזיכרון.

למה מופיעה שגיאת KeyError qwen2 כשאני מנסה לטעון אותו?

הארכיטקטורה של הדגם נתמכת רק מספריות transformers בגרסה 4.37.0 ומעלה. שדרוג פשוט של החבילה בסביבת העבודה שלכם יפתור את הבעיה מיד.

איך מריצים

המשקל הכולל של הקבצים עומד על 5.8 גיגהבייט בדיוק של bfloat16. זה אומר שכרטיס מסך בסיסי עם 8 או 12 גיגהבייט של זיכרון יריץ אותו בקלות בלי להזיע, ואפשר אפילו לדחוף אותו למעבדים מקומיים או מכשירי קצה אם משתמשים בכימות מתאים. כדי לעבוד איתו צריך סביבת transformers מגרסה 4.37.0 ומעלה, אחרת תקבלו שגיאת מפתח על הארכיטקטורה.

אם אתם צריכים רק מדי פעם לעבד טקסטים קצרים או שאין לכם כוח לנהל תשתית והקצאת זיכרון, עדיף להשתמש בנקודת קצה מנוהלת דרך API. להרים אותו לבד שווה את זה רק כשאתם רוצים פרטיות מוחלטת של הנתונים, זמני תגובה מהירים בלי תלות ברשת, או חיסכון בעלויות בהיקפי עבודה גבוהים.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen2.5-3B-Instruct")
print(pipe("שלום"))

הרישיון

הרישיון של הדגם מוגדר כ־other ולא תחת רישיון קוד פתוח סטנדרטי כמו Apache או MIT. המשמעות היא שחובה להיכנס למסמכי הרישיון המקוריים של היוצרים ולבדוק את התנאים המדויקים לפני שמשלבים אותו במוצר מסחרי, כי ייתכנו הגבלות על שימוש מסחרי או דרישות הפצה ספציפיות.

הרישיון המלא בעמוד המודל ↗