GPT
Q

QwQ-32B-Preview

קוד פתוח

Qwenapache-2.02024-11-27

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • chat

יש כאן גם סקירה על Qwen עצמו.

גרסת מחקר ממוקדת חשיבה ופתרון בעיות מורכבות. היא מעניינת בעיקר מתכנתים שרוצים יכולות מתמטיקה וקוד חזקות במודל פתוח שלא דורש אשכול שרתים ענק.

  • 33Bפרמטרים
  • 32,768טוקנים בהקשר
  • 61.0 GBמשקל הקבצים
  • 11,755הורדות בחודש

מה זה

מדובר במודל שמכוון לחשיבה אנליטית, פיצוח בעיות בקוד ומתמטיקה, במקום סתם לפלוט טקסט שנשמע טוב. בסיס המבנה שלו נשען על סדרת Qwen2.5 עם שלושים ושניים מיליארד פרמטרים ושישים וארבע שכבות. המפתחים הגדירו אותו במפורש כגרסת תצוגה מקדימה ניסיונית, שנועדה לבחון שיטות אימון של הסקת מסקנות ושרשראות חשיבה.

הוא שונה ממודלים רגילים באותו סדר גודל בכך שהוא משקיע משאבים ומאמץ בלפרק שאלות מורכבות שלב אחרי שלב. במקום לתת תשובה מיידית וקצרה, הוא מנתח לעומק בעיות תכנותיות וחישובים, תחומים שבהם רוב המודלים בגודל בינוני נוטים להמציא שטויות או להישבר באמצע.

לפי כרטיס המודל, היתרון הבולט שלו מתרכז בעיקר במשימות כמותיות וטכניות. לעומת זאת, הבנת שפה טבעית דקה והיגיון יומיומי פשוט מקבלים פחות דגש, כך שלא מדובר במודל שמתאים לכתיבת תוכן שיווקי או לשיחה חברתית קלילה.

מתאים ל

  • פתרון בעיות מתמטיקה

    הארכיטקטורה אומנה במיוחד לחשיבה אנליטית וחישובים מורכבים שלב אחר שלב.

  • יצירה ובדיקת קוד

    מתאים לניתוח אלגוריתמים וכתיבת סקריפטים טכניים שדורשים מעקב לוגי קפדני.

  • מחקר על שרשראות חשיבה

    כלי פתוח לבדיקת תהליכי הסקת מסקנות ולולאות לוגיות במודלים שאינם סגורים.

איפה זה נופל

זהו שחרור מוקדם, והמפתחים מודים בכמה בעיות קשות. המודל עלול להיכנס ללולאות חשיבה אינסופיות, לכתוב הסברים ארוכים מדי ובסוף לא לספק שום תשובה סופית. בנוסף, הוא סובל מערבוב שפות ומחליף ביניהן באמצע התשובה בלי סיבה נראית לעין. הוא חלש בהיגיון בסיסי של יום יום, ומנגנוני הבטיחות שלו דורשים הידוק ידני, כך שלא כדאי להציב אותו מול משתמשי קצה במוצר פעיל בלי סינון הדוק.

אותה משפחה

QwQ יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להשתמש בו עבור בוט שירות בעברית?

ממש לא. המודל מוגדר רשמית עבור אנגלית, סובל מנטייה מובנית לערבב שפות באמצע משפט, וחסר לו היגיון בסיסי בשיחה חופשית. לשיחות שירות עדיף לקחת מודל שיחה רגיל.

למה המודל מחזיר לפעמים פלט ענק בלי תשובה תכלס?

זו אחת המגבלות הידועות שהיוצרים מציינים בכרטיס. המודל עלול להיכנס למעגלי חשיבה רקורסיביים שבהם הוא מנתח את עצמו שוב ושוב בלי להגיע למסקנה, ולכן צריך להגדיר לו מגבלת טוקנים נוקשה ולעקוב אחרי הפלטים.

איך מריצים

המשקל הכולל של הקבצים מגיע לשישים ואחד גיגה בייט בדיוק של bfloat16. כדי להריץ אותו מקומית בלי קוונטיזציה תצטרכו שרת עם שני כרטיסי מסך של עשרים וארבעה גיגה בייט לפחות, או כרטיס בודד של שמונים גיגה בייט, במיוחד אם רוצים לנצל את חלון ההקשר המלא של שלושים ושניים אלף טוקנים.

אם אין לכם חומרה כזו במשרד או בענן פרטי, הרבה יותר זול ופשוט לגשת אליו דרך שירות ענן שמציע אותו או דרך הצ׳אט של המפתחים. לטעינה בקוד תצטרכו גרסת transformers מודרנית, כי גרסאות ישנות יותר מגרסה 4.37.0 נכשלות בזיהוי הארכיטקטורה וזורקות שגיאה.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/QwQ-32B-Preview")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינויים והפצה של המודל, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי. אפשר לשלב אותו במוצרים פנימיים או מסחריים בלי לשלם תמלוגים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗