GPT
Q

Qwen3-1.7B

קוד פתוח

Qwenapache-2.02025-04-27

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

זה מודל קטן של 2 מיליארד פרמטרים שמשלב מצב חשיבה עמוק ומצב שיחה רגיל באותו משקל, עם תמיכה מעל מאה שפות ורישיון חופשי.

  • 2Bפרמטרים
  • 40,960טוקנים בהקשר
  • 3.8 GBמשקל הקבצים
  • 3,441,144הורדות בחודש

מה זה

הייחוד כאן הוא השילוב בין מודל שיחה רגיל לבין יכולות הסקה ולוגיקה בתוך אותו קובץ של פחות מארבעה גיגהבייט. במקום להחזיק מודל ייעודי למתמטיקה וקוד ומודל נפרד לתשובות מהירות, אפשר לעבור בין המצבים באמצעות דגל בהגדרות הטוקנייזר או פקודות בתוך הפרומפט עצמו.

בגודל הזה בדרך כלל מקבלים מודלים שמתקשים לבצע פעולות מורכבות או לעבוד עם כלים חיצוניים. כאן שמו דגש על אינטגרציה עם כלים דרך תבניות ייעודיות וקריאה לפונקציות, כשהוא מתעלה על דורות קודמים כמו סדרת 2.5 והניסיונות הראשונים שלהם במודלי חשיבה, במיוחד כשמשאירים לו מספיק טוקנים להשלים את שלבי ההסקה לפני התשובה הסופית.

מתאים ל

  • סוכן מקומי להרצת פקודות

    מתאים לחיבור מול כלים וקריאות מערכת מקומיות בזכות יכולות הסוכן המובנות וגודל הזיכרון הזעיר.

  • פתרון בעיות לוגיות בקצה

    מצב החשיבה מאפשר לו לפרק שאלות מורכבות במתמטיקה או קוד גם על מכשירי קצה ללא חיבור רשת.

  • סיווג וניתוח טקסט מהיר

    כיבוי מצב החשיבה הופך אותו למנוע טקסט קל וזול לעיבוד כמויות גדולות של פניות.

איפה זה נופל

הבעיה המרכזית שלו היא חזרתיות בלתי נגמרת. הכרטיס מדגיש שאסור להשתמש בפיענוח חמדן (greedy), וממליץ להעלות את מקדם ה־presence_penalty עד 1.5 כדי למנוע ממנו להיתקע בלולאות, דבר שיכול לגרור ערבוב שפות וירידה באיכות הפלט. בנוסף, בשיחות מרובות תורות אתם חייבים לוודא שבלוק החשיבה נמחק מההיסטוריה ולא מועבר חזרה פנימה, אחרת המודל מאבד יציבות במהירות.

אותה משפחה

Qwen3 יצא ב־32 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

למה המודל חוזר על אותם משפטים שוב ושוב?

זה קורה כשמריצים אותו בפיענוח חמדן או בטמפרטורה לא נכונה. יש להגדיר טמפרטורה של 0.6 במצב חשיבה או 0.7 במצב רגיל, ובמידת הצורך להעלות את ה־presence penalty ל־1.5 כפי שהמפתחים ממליצים.

האם חייבים להשתמש במצב החשיבה האיטי?

לא, אפשר לכבות אותו לגמרי בהגדרת תבנית הצ'אט כדי לחסוך זמן ומשאבים. אפשר גם לשלוט בו פר פנייה באמצעות הוספת /think או /no_think בגוף ההודעה.

כמה זיכרון וידאו צריך בפועל כדי להריץ אותו?

הקבצים שוקלים 3.8 גיגהבייט, כך שכרטיס עם 6 עד 8 גיגהבייט יספיק להרצה מלאה. אם רוצים לנצל את מלוא חלון ההקשר הארוך בשרתי הסקה, כדאי לשריין לפחות 12 גיגהבייט למניעת חריגות זיכרון ב־KV cache.

איך מריצים

בגלל משקל של 3.8 גיגהבייט בפורמט bfloat16, המודל הזה רץ בנוחות על כרטיס מסך בסיסי עם 6 עד 8 גיגהבייט זיכרון, או אפילו על מחשב נייד עם Ollama, llama.cpp ו־MLX. בשרתים אפשר להרים אותו דרך vLLM או SGLang עם תמיכה מובנית בפיענוח בלוק החשיבה, רק צריך לוודא שמשתמשים בגרסת transformers מודרנית מ־4.51.0 ומעלה כדי לא לחטוף שגיאות טעינה.

אם אתם צריכים רק מענה מהיר לבקשות בודדות בלי לנהל תשתית, עדיף להשתמש בשרת מנוהל חיצוני. מצד שני, בנפח שימוש גבוה או כשרוצים להריץ לוגיקה מקומית על קצה בלי תלות ברשת, החומרה הנדרשת כל כך זולה שאין שום סיבה לשלם לספק ענן פר קריאה.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-1.7B")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים סגורים ולהפיץ אותו, כל עוד שומרים על הודעת זכויות היוצרים וכתב הוויתור המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗