GPT
Q

Qwen3.6-35B-A3B-TQ3_4S

קוד פתוח

YTan2000apache-2.02026-04-16

  • gguf
  • GGUF
  • llama.cpp
  • qwen3.6
  • qwen

גרסה מכווצת של מודל מולטימודלי עם תערובת מומחים, שנכנסת כולה לכרטיס מסך ביתי בודד של 16 גיגה זיכרון. פתרון למי שרוצה ראייה ממוחשבת והפעלת כלים מקומית בלי שרת יקר.

  • 13.2 GBמשקל הקבצים
  • 1,737הורדות בחודש
  • 83לייקים

מה זה

מדובר בכיבוץ אגרסיבי של מודל המקור ממשפחת קוון, שמנצל את המבנה של ארכיטקטורת המומחים כדי לחתוך במשקל. רק שמונה מתוך 256 מומחים פעילים בכל טוקן, ולכן רוב הפרמטרים במנגנון המומחים נדחסו לשני ביט בלבד, בעוד שתשומת הלב נשמרה בארבעה ביט והשכבות הקריטיות בששה ביט. הקובץ המרכזי שוקל 12.4 גיגה בלבד, יחד עם מקרן תמונה נפרד בפורמט ביפלוט16.

המודל כולל יכולות עיבוד תמונה וטקסט לצד תמיכה בקריאות לפונקציות חיצוניות. מבחן האיכות שמציג היוצר מבוסס על עשר שאלות בסיסיות מאוד כמו בירת צרפת ותרגום פשוט, כך שאינו מעיד על יכולת אנליטית עמוקה, אך במבחני הפעלת כלים המודל קיבל ציון מלא בבחירת פונקציות, עבודה בשלבים והתמודדות עם מרכאות כפולות, גם במצב חשיבה מופעל וגם כשהוא כבוי.

כרטיס מסך ארטיאיקס 5060 טי של 16 גיגה מספק קצב יצירה של 107 טוקנים לשנייה וקריאת פרומפט של 1832 טוקנים לשנייה. אלה ביצועים גבוהים מאוד למודל בגודל כזה, שנובעים ישירות מהדחיסה הנמוכה ומאי הפעלת כל הפרמטרים בו זמנית.

מתאים ל

  • סוכני קוד מקומיים

    מבצע קריאות לפונקציות חיצוניות בדיוק מוכח, מתאים להרצה באוטומציות פיתוח על מחשב אישי.

  • ניתוח תמונות במסך בודד

    כולל מקרן ויזואלי ונכנס כולו לכרטיס של 16 גיגה, ללא צורך בשרתים מרובי מעבדים גרפיים.

  • שרת הסקה פרטי ומהיר

    מפיק מעל מאה טוקנים לשנייה במחשב קצה, מתאים למערכות פנימיות שלא יכולות להוציא מידע החוצה.

איפה זה נופל

הקוונטיזציה כאן קיצונית מאוד, שני ביט לחלקים נרחבים מהרשת, והיא עלולה לפגוע ביכולות ניסוח עדינות או במשימות מורכבות שלא נבדקו בעשר שאלות הטריוויה של המפתח. בנוסף, המודל מוגדר רשמית רק באנגלית, כך שאין שום הבטחה שיעבוד בצורה תקינה בעברית. שימוש בעונש נוכחות מעל 0.5 הורס את הפלט המבני וגורם ללולאות בקריאות לכלים, ואם מפעילים מצב חשיבה חייבים מנגנון שיזהה תקיעה ויעצור אחרי שלוש שגיאות.

שאלות
נפוצות

האם אפשר להריץ אותו בתוכנת לאמה רגילה מהקופסה?

לא. המודל דורש מזלג ייעודי של לאמה סיפיפי שתומך בפורמט טורבוקוואנט 3, ומפורט בקישור ישיר בעמוד המודל. בלעדיו הקבצים לא ייטענו.

האם המודל יבין הנחיות בעברית?

הנתונים הרשמיים מציינים אנגלית בלבד. ייתכן שהוא יבין מילים מסוימות בגלל המאגר הרחב של מודל הבסיס, אך הדחיסה האגרסיבית והיעדר תמיכה רשמית הופכים אותו ללא מתאים ליישומים בעברית.

איך מריצים

כדי להריץ את המודל אי אפשר להשתמש בגרסה הרגילה של לאמה סיפיפי, אלא חייבים מזלג ייעודי בשם טורבוקוואנט. ההרצה נעשית דרך שרת לאמה עם דגלים ספציפיים לזיכרון המטמון, תבנית ג'ינג'ה וביטול מנגנון החשיבה המובנה עבור הפעלת כלים יציבה. מקרן התמונה דורש דגל ביטול פריקה ייעודי.

חומרה של 16 גיגה זיכרון וידאו מספיקה לטעינה מלאה של כל השכבות ללא צורך במעבד המחשב. אם אין לכם כרטיס עם נפח כזה או שאתם לא רוצים להסתבך עם הידור של גרסה מותאמת, עדיף לקרוא למודל דרך שירות מנוהל חיצוני.

ollama run hf.co/YTan2000/Qwen3.6-35B-A3B-TQ3_4S:BF16

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

6 קבצים במאגר, 13.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י 2.0, בדיוק כמו מודל הבסיס. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו הלאה, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗