GPT
Q

Qwen2.5-32B-Instruct-GPTQ-Int4

קוד פתוח

Qwenapache-2.02024-09-17

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • chat

יש כאן גם סקירה על Qwen עצמו.

גרסת 4-ביט מכווצת למודל של 32 מיליארד פרמטרים שמתאימה לכרטיס מסך בודד. מקבלים יכולות קוד וניתוח טבלאות של מודל ענק בלי להחזיק שרת כפול.

  • 33Bפרמטרים
  • 32,768טוקנים בהקשר
  • 18.0 GBמשקל הקבצים
  • 548,879הורדות בחודש

מה זה

מדובר במודל שיחה מכווץ בשיטת GPTQ לדיוק של 4 ביט, שיושב על ארכיטקטורת Qwen2.5 עם 32 מיליארד פרמטרים. המשקל שלו צומצם ל־18 גיגה-בייט בלבד, מה שמאפשר להריץ אותו מקומית על חומרה צנועה יחסית בלי לאבד את היכולות של המודל המקורי. הוא תוכנן במיוחד לעבודה עם טקסטים ארוכים, יצירת קוד, מתמטיקה והבנה של נתונים מובנים כמו טבלאות.

הוא מתוכנת לעקוב אחרי הוראות מורכבות ומייצר פלט מובנה, בייחוד JSON, בצורה עקבית יותר מגרסאות קודמות. ברירת המחדל תומכת ב־32 אלף טוקנים, אבל תמיכה בהרחבה מאפשרת לקרוא עד 128 אלף טוקנים ולייצר פלטים רצופים של עד 8,000 טוקנים. הוא יודע לעבוד עם מעל 29 שפות שונות, ביניהן ערבית, רוסית, ספרדית ואנגלית, ומציג גמישות בהגדרות תפקיד בשיחה.

מתאים ל

  • חילוץ מידע לפורמט JSON

    המודל אומן במיוחד להבנת טבלאות ויצירת מבני נתונים תקינים, מה שמבטיח פלט מדויק בלי שגיאות תחביר.

  • סיוע בכתיבת קוד ובדיקות

    כולל שיפורים במתמטיקה ופיתוח תוכנה, ומתאים לשילוב בסביבות פיתוח פנימיות שדורשות שמירה על פרטיות.

  • בוט שיחה בארגון מקומי

    נכנס לכרטיס מסך בודד של 24 גיגה-בייט ומאפשר שימוש בטוח בתוך הרשת המקומית בלי להוציא נתונים החוצה.

איפה זה נופל

הבעיה המרכזית נמצאת בהרחבת חלון ההקשר מעבר ל־32 אלף טוקנים. כדי להגיע ל־128 אלף טוקנים צריך להפעיל מנגנון הרחבה בשם YaRN בתוך הקונפיגורציה. vLLM תומך רק בגרסה סטטית שלו, מה שפוגע באיכות התשובות כשמריצים טקסטים קצרים רגילים. אם תדליקו את ההרחבה מראש, המודל יעבוד פחות טוב בשיחות שגרתיות. בנוסף, עברית לא מצוינת במפורש ברשימת השפות הנתמכות, ולכן צריך לבדוק את איכות הפלט בעברית לפני שבונים עליו למוצר מקומי.

אותה משפחה

Qwen2.5 יצא ב־29 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב ביתי בלי כרטיס מסך מקצועי?

אפשר להריץ אותו על כרטיס מסך ביתי חזק שיש לו 24 גיגה-בייט זיכרון גרפי, כמו כרטיסים מהסדרות הגבוהות. אם יש לכם פחות מזה, תצטרכו להשתמש בזיכרון הראשי של המחשב, מה שיגרום למודל לפעול באיטיות קיצונית שלא מתאימה לשימוש שוטף.

למה לא להשתמש ישר בחלון ההקשר המלא של 128 אלף טוקנים?

הקובץ מוגדר כברירת מחדל לעד 32,768 טוקנים כדי לשמור על ביצועים טובים. הפעלת מנגנון YaRN לצורך הגדלה ל־128 אלף טוקנים ב־vLLM עובדת בצורה סטטית, ופוגעת באופן מורגש באיכות התשובות על טקסטים קצרים.

איך מריצים

בגלל הכיווץ ל־4 ביט, כל המודל תופס 18 גיגה-בייט זיכרון. כרטיס מסך בודד עם 24 גיגה-בייט VRAM יספיק כדי להריץ אותו, בתנאי שמשתמשים בחלון הקשר סביר ולא דוחפים את הזיכרון לקצה. תצטרכו גרסת transformers מודרנית (4.37.0 ומעלה) כדי להימנע משגיאות טעינה, והיוצרים ממליצים להשתמש ב־vLLM כדי לשרת בקשות ביעילות.

אם אתם מתכננים לעבוד עם קלטים קצרים בלבד ומעט משתמשים, שרת ייעודי בענן עם כרטיס בודד יהיה זול ומשתלם. אבל אם אתם צריכים לפתוח את מלוא חלון ההקשר ל־128 אלף טוקנים או לשרת עומס תנועה משתנה, ניהול הזיכרון והתשתיות ידרוש כרטיסים חזקים ויקרים בהרבה, ושם כבר עדיף לשלם לפי קריאה ל־API חיצוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen2.5-32B-Instruct-GPTQ-Int4")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי לחלוטין, שינוי של המשקלים והפצה בתוך מוצרים סגורים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי תמלוגים או הגבלות שימוש נוספות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗