GPT
Q

Qwen2.5-14B-Instruct-AWQ

קוד פתוח

Qwenapache-2.02024-09-17

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • chat

יש כאן גם סקירה על Qwen עצמו.

גרסה מכווצת בארבעה ביט של מודל ה־14B מבית Qwen, שמיועדת להרצה מקומית בלי לבלוע שרת שלם. היא מתאימה למי שרוצה ביצועי קוד והוראות בלי לשלם על כל קריאת API.

  • 15Bפרמטרים
  • 32,768טוקנים בהקשר
  • 9.3 GBמשקל הקבצים
  • 2,136,387הורדות בחודש

מה זה

מדובר במודל שפה בגודל ביניים שעבר אופטימיזציית AWQ ל־4 ביט, מה שמקצץ את המשקל שלו לכ־9.3 גיגה-בייט. בסדרה הזו היצרן שם דגש על מתמטיקה, כתיבת קוד והבנה טובה יותר של טבלאות ופורמטים קשיחים כמו JSON, לצד יכולת טובה יותר לאמץ הנחיות מערכת מורכבות לשיחות מבוססות תפקיד.

המודל כולל 48 שכבות ומנגנון קשב מקובץ (GQA). הוא בנוי מראש לקבל קלט באורך של עד 32,768 טוקנים בהגדרה הרגילה, ויכול להתרחב לטקסטים ארוכים בהרבה, מה שמאפשר לו להחזיק שיחה מתמשכת או קבצי קוד שלמים בלי לאבד את ההקשר.

מתאים ל

  • עבודה עם פלטי JSON

    המודל אומן במיוחד להחזיר מבנים מוגדרים היטב, מה שמצוין לבניית סוכנים ואוטומציות.

  • סיוע בכתיבת קוד

    גרסת 14B מציגה הבנה חזקה בשפות תכנות ומתאימה לשילוב בעורכי קוד מקומיים.

  • בוטים לתמיכה מקומית

    משקל של 9.3GB מאפשר הרצה שקטה ומאובטחת על שרת פנימי בלי להוציא מידע החוצה.

איפה זה נופל

החולשה העיקרית קשורה לעבודה עם טקסטים ארוכים מעבר ל־32K טוקנים. כדי להגיע לטווח המלא צריך להפעיל מנגנון הרחבה בשם YaRN בתוך הקונפיגורציה, אבל המפתחים מודים שבכלים כמו vLLM המנגנון פועל בצורה סטטית, וזה עלול לפגוע באיכות התשובות כשמזינים דווקא טקסטים קצרים.

בנוסף, הכרטיס מדווח רק על אנגלית ברישום הראשי למרות התמיכה בשפות נוספות, כך שחובה לבדוק היטב את איכות העברית שלו לפני שמשלבים אותו בפיתוח שמיועד למשתמשים ישראלים.

אותה משפחה

Qwen2.5 יצא ב־29 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם המודל ידרוש שרת ענן יקר כדי לרוץ?

לא. בגלל הדחיסה ל־4 ביט, המשקל שלו הוא 9.3 גיגה-בייט בלבד. כרטיס גרפי מודרני עם 16GB זיכרון יספיק כדי להעלות אותו ולעבוד איתו בצורה מקומית.

האם כדאי להפעיל תמיכה בטקסטים ארוכים מעל 32K טוקנים מראש?

לא מומלץ לעשות את זה אלא אם חייבים. הכרטיס מציין שההרחבה באמצעות YaRN במנועים כמו vLLM היא סטטית ועלולה להוריד את איכות הפלט בטקסטים רגילים וקצרים.

איך מריצים

המשקל הצנוע מאפשר לדחוף אותו למאיץ גרפי בודד עם 16 גיגה-בייט של VRAM, כמו כרטיסי מסך צרכניים חזקים, בלי להזדקק לתשתית ענן מורכבת של כמה כרטיסים. הריצה מתבצעת ישירות דרך ספריית transformers העדכנית (גרסה 4.37.0 ומעלה) או בסביבות כמו vLLM שמספקות קצב יצירה גבוה בהרבה.

אם אתם צריכים תפוקה גדולה מאוד של משתמשים במקביל או שאין לכם כרטיס גרפי מתאים זמין, עדיף להשתמש ב־API מנוהל של המודל המקורי. הרצה עצמית שווה את הטרחה רק אם הפרטיות של הנתונים קריטית לכם או אם אתם רוצים להימנע מעלויות שוטפות של ענן חיצוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen2.5-14B-Instruct-AWQ")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. זה אומר שמותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים פנימיים או למכור שירותים שמבוססים עליו, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗