GPT
Q

Qwen3-1.7B-GGUF

קוד פתוח

unslothapache-2.02025-04-28

  • transformers
  • gguf
  • qwen3
  • text-generation
  • qwen

מודל שפה קומפקטי שמביא יכולות חשיבה לוגית ופתרון בעיות למכשירים מקומיים. הוא מתאים למי שחייב להריץ מודל חושב על חומרה מוגבלת בלי להסתמך על שירותי ענן.

  • 40,960טוקנים בהקשר
  • 28.2 GBמשקל הקבצים
  • 55,616הורדות בחודש
  • 74לייקים

מה זה

מדובר בגרסת GGUF של Qwen3 עם 1.7 מיליארד פרמטרים, שפותחה במקור על ידי עליבאבא ונארזה מחדש על ידי Unsloth. החידוש העיקרי כאן הוא מנגנון החלפה בין שני מצבי עבודה באותו קובץ: מצב חשיבה שמשתמש בשרשראות היסק בתוך תגיות ייעודיות לפתרון משימות קוד ומתמטיקה, ומצב ישיר ומהיר לשיחה רגילה. המעבר מתבצע פשוט על ידי שליחת הפקודות think/ או no_think/ בתוך השיחה.

הוא שונה מדגמים קטנים קודמים בכך ששולבו בו יכולות הפעלת כלים וסוכנים לצד תמיכה בחלון הקשר עמוק, שמגיע עד 32,768 טוקנים בהמלצות העבודה ומדווח ברמת ארכיטקטורה של עד 40,960 טוקנים. הוא עוצב להחליף מודלים ייעודיים לפתרון בעיות בלי לדרוש משאבים כבדים, וכולל ארכיטקטורת 28 שכבות עם מנגנון GQA.

מתאים ל

  • סוכן מקומי להפעלת כלים

    ביצוע קריאות לפונקציות וכלים חיצוניים על חומרת קצה ללא שליחת נתונים החוצה.

  • עוזר שיחה במכשירים ניידים

    תפעול צ'אט מקומי ומהיר במצב ללא חשיבה על מעבדים פשוטים וזיכרון נמוך.

  • פתרון בעיות קוד במצב מבודד

    מצב חשיבה שמאפשר היסק לוגי ובדיקת קוד ללא תלות ברשת חיצונית.

איפה זה נופל

הגודל הקומפקטי גובה מחיר ביציבות ההיסק. היוצרים מזהירים במפורש לא להשתמש ב־greedy decoding במצב חשיבה, כי המודל נכנס לחזרות אינסופיות וירידה קשה בביצועים. חובה לקנפג טמפרטורה מדויקת של 0.6 ופרמטרים מוגדרים מראש. בנוסף, אם תעלו את ערך ה־presence_penalty כדי למנוע חזרות, המודל עלול לערבב שפות באמצע התשובה. מבחינת שפות המידע הרשמי מצהיר על אנגלית בלבד, כך שעבודה בעברית מחייבת בדיקה יסודית ולא מובטחת מראש.

אותה משפחה

Qwen3 יצא ב־10 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם חייבים להוריד את כל 28 הג'יגה כדי להשתמש במודל?

לא. המאגר כולל 32 קבצים שמכילים גרסאות שונות ורמות כימות מגוונות של המודל. אתם בוחרים ומורידים רק קובץ GGUF אחד ברמת הכימות שמתאימה לזיכרון הפנוי שלכם.

איך משנים את מצב הפעולה בין מענה מהיר לחשיבה מעמיקה?

אפשר לשלוט בזה דרך הטמפלייט של השיחה באמצעות הגדרת enable_thinking, או דינמית בתוך הטקסט שלכם. הוספת תגית think/ מעבירה אותו לחשיבה מפורטת בתוך תגיות, ותגית no_think/ מחזירה אותו למענה מיידי.

איך מריצים

בגלל הפורמט של GGUF, אתם מריצים אותו ישירות דרך ספריות כמו llama.cpp, Ollama או בסביבות כמו vLLM ו־SGLang. משקל הקבצים הכולל במאגר עומד על 28.2 ג'יגה בייט על פני 32 קבצים, אבל מדובר באוסף של דרגות כימות שונות, כך שבפועל מורידים רק קובץ כימות בודד. בשביל להריץ אותו לא צריך כרטיס גרפי של שרתים. מחשב נייד מודרני עם מעבד סביר וכמה גיגה בייט בודדים של זיכרון פנוי יריץ אותו בקלות.

שימו לב לדרישות התוכנה: חובה לעבוד עם גרסת transformers מודרנית של 4.51.0 ומעלה כדי להימנע משגיאת זיהוי ארכיטקטורה. אם המטרה שלכם היא להריץ משימות חשיבה מורכבות במיוחד שדורשות פלט ארוך של עשרות אלפי טוקנים, תצטרכו להקצות מספיק זיכרון ל־KV cache, ואז כדאי לשקול פתרונות ענן ייעודיים.

ollama run hf.co/unsloth/Qwen3-1.7B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי הקוד, שילוב במוצרים סגורים והפצה מחדש. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים וכתב הוויתור על אחריות, ללא דרישה לחשוף את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗