GPT
Q

Qwen/Qwen3-1.7B-GGUF

קוד פתוח

Qwenapache-2.02025-05-05

  • gguf
  • text-generation
  • endpoints_compatible
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל קומפקטי במיוחד שיודע לעבור בין מצב חשיבה עמוק למענה מהיר לפי פקודה. הוא שוקל פחות משני ג'יגה ורץ מקומית בלי לגעת בחומרה יקרה.

  • 1.7 GBמשקל הקבצים
  • 44,134הורדות בחודש
  • 67לייקים

מה זה

מדובר במודל שפה של 1.7 מיליארד פרמטרים בגרסת GGUF שעבר קוונטיזציה לפורמט q8_0. הייחוד העיקרי שלו מול מודלים אחרים בגודל הזה הוא היכולת לדלג בין מצב חשיבה שבו הוא מפרק בעיות ומנמק לפני שהוא עונה, לבין מצב רגיל ומהיר לשיחות פשוטות. המעבר מתבצע ישירות בתוך הפרומפט בלי להחליף מודל או לטעון משקלים חדשים.

הוא מבוסס על ארכיטקטורה של 28 שכבות עם מנגנון GQA לחסכון בזיכרון, ותומך בחלון הקשר של 32,768 טוקנים. לפי הכרטיס שלו הוא תומך ביותר ממאה שפות כולל משימות תרגום, ומיועד גם לשילוב עם כלים חיצוניים וסוכנים עצמאיים.

מתאים ל

  • עוזר מקומי על לפטופ

    שוקל 1.7 ג'יגה בייט ועובד חלק על חומרה יומיומית בלי אינטרנט ובלי צריכת זיכרון כבדה.

  • סוכן כלים קל משקל

    יודע להתחבר לכלים חיצוניים ולהפעיל פונקציות גם במצב ריצה מהיר וגם עם נימוק.

  • תרגום ומענה רב־לשוני

    תומך ביותר ממאה שפות ומאפשר הפעלה זולה ומקומית למשימות טקסט שאינן באנגלית.

איפה זה נופל

המודל רגיש מאוד לפרמטרי הדגימה שלו. הכרטיס מזהיר במפורש לא להשתמש ב־greedy decoding כי זה מוביל לחזרות אינסופיות וירידה בביצועים. בנוסף, מומלץ לקבוע ענישה על חזרתיות בערך של 1.5, אבל ערך גבוה עלול לגרום לערבוב בין שפות ולפגוע באיכות התשובה.

נקודה נוספת שחייבים לבדוק ביישום היא ניהול היסטוריית השיחה. אם המערכת שלכם לא מסננת את תוכן החשיבה מההיסטוריה לפני הפנייה הבאה, המודל יאבד את הכיוון. מפתחים שלא משתמשים בתבנית ברירת המחדל צריכים לבנות את הניקוי הזה ידנית.

אותה משפחה

Qwen3 יצא ב־32 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך שולטים במצב החשיבה שלו?

פשוט מוסיפים לפרומפט think/ כדי שהוא יציג את תהליך המחשבה לפני התשובה, או no_think/ אם רוצים תגובה ישירה. המודל מתאים את עצמו לפי ההוראה האחרונה שקיבל בשיחה.

למה המודל חוזר על עצמו שוב ושוב בתשובות?

הכרטיס מדגיש שחייבים להגדיר presence_penalty בערך 1.5 כדי למנוע לולאות חזרה, במיוחד בגרסאות מכווצות כאלה. אסור להשתמש ב־greedy decoding, ויש להשתמש בטמפרטורה של 0.6 או 0.7 בהתאם למצב העבודה שבחרתם.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.7 ג'יגה בייט, כך שאפשר להריץ אותו בקלות על מעבד רגיל של מחשב נייד או כרטיס מסך בסיסי. אפשר להעלות אותו בפקודה בודדת דרך Ollama ישירות מ־Hugging Face, או להשתמש ב־llama-cli עם דגלי Jinja כדי לנהל את התבנית כמו שצריך.

אם אתם צריכים רק מענה מהיר וקצר על שרת קטן, הוא מעולה ולא דורש הוצאות על ענן. מנגד, אם אתם בונים מערכת שדורשת ניתוח לוגי עמוק ומורכב במיוחד לאורך זמן, מודל של 1.7B עדיין מוגבל פיזית בידע שלו ועדיף לפנות למודלים גדולים יותר דרך שירות חיצוני.

ollama run hf.co/Qwen/Qwen3-1.7B-GGUF:Q8_0

הקבצים

5 קבצים במאגר, 1.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל משוחרר תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית והרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗