GPT
Q

Qwopus3.6-35B-A3B-v1-MTP-GGUF

קוד פתוח

Jackrongapache-2.02026-05-23

  • transformers
  • gguf
  • llama.cpp
  • image-text-to-text
  • vision

גרסת GGUF של מודל מולטימודלי בגודל 35 מיליארד פרמטרים, שמשלבת ראשי חיזוי מרובה תווים להאצת ההסקה. היא מיועדת למי שמחפש מהירות יצירה גבוהה יותר בהרצה מקומית על גבי llama.cpp.

  • 123 GBמשקל הקבצים
  • 1,243הורדות בחודש
  • 57לייקים

מה זה

מדובר בהמרה של המודל Jackrong/Qwopus3.6-35B-A3B-v1 לפורמט GGUF, שמטפלת במשימות טקסט לצד תמונות. הייחוד של הגרסה הזו נעוץ בשימור ראשי ה־MTP שנלקחו מגרסת unsloth. המבנה הזה נועד לחזות כמה תווים קדימה בבת אחת ולא רק תו בודד בכל צעד, מה שפותח אפשרות לפענוח ספקולטיבי כשמצמידים לו מודל טיוטה מתאים.

בגודל כזה של 35 מיליארד פרמטרים, צוואר הבקבוק העיקרי הוא לרוב מהירות יצירת הטקסט והתעבורה מהזיכרון. במקום לשלם את מלוא מחיר השיהוי על כל טוקן, ארכיטקטורת החיזוי המקבילי מאפשרת למנועי הסקה תומכים לבדוק מספר השערות במקביל. מי שצריך מענה זריז מקומית משולב ביכולות עיבוד תמונה בשפות כמו אנגלית, סינית או רוסית, ימצא כאן שילוב שאינו נפוץ בפורמטים רגילים.

מתאים ל

  • הסקה מהירה מקומית

    ראשי החיזוי המרובה מאפשרים פענוח ספקולטיבי שמקצר את זמני ההמתנה לפלט.

  • ניתוח מסמכים ותמונות

    ארכיטקטורת תמונה לטקסט מתאימה לעיבוד חזותי בשפות הנתמכות כמו אנגלית וספרדית.

  • שילוב ביישומי llama.cpp

    הפורמט מכיל מגוון קוונטיזציות מ־Q2 ועד BF16 להתאמה לחומרה שברשותכם.

איפה זה נופל

המודל כולל תמיכה מוגדרת בחמש שפות בלבד, ביניהן אנגלית, סינית וספרדית, ללא שום אזכור או התחייבות לעברית. אם אתם צריכים הבנה או ייצור של עברית איכותית, סביר שתקבלו תוצאות עילגות או שגיאות.

חיסרון בולט נוסף הוא היעדר מוחלט של תוצאות מבחני ביצועים בכרטיס המודל. אין נתונים שמראים בכמה אחוזים המהירות עולה בפועל, ואין מדדים על איכות הפלט במשימות ראייה ממוחשבת לעומת מודלים אחרים, כך שתצטרכו לבדוק בעצמכם אם הדיוק לא נפגע בקוונטיזציות הנמוכות.

שאלות
נפוצות

האם המודל שווה משהו בלי מודל טיוטה להאצה?

הוא יעבוד כמו כל מודל 35B רגיל, אבל תאבדו את כל היתרון שלשמו הוסיפו את ראשי ה־MTP. כדי להרוויח את קפיצת המהירות בפועל תצטרכו להגדיר מודל טיוטה תואם במנוע ההסקה.

האם הוא יעבוד בעברית?

כרטיס המודל מציין רשמית רק אנגלית, סינית, ספרדית, רוסית ויפנית. עברית אינה ברשימה, ולכן לא מומלץ להסתמך עליו לפרויקטים שדורשים שליטה טובה בשפה.

איך מריצים

כדי להריץ את המודל תצטרכו סביבה כמו llama.cpp שתומכת בראשי MTP כדי לנצל את יתרון המהירות. המשקל הכולל של הקבצים מגיע ל־123 גיגה בייט, אך הקוונטיזציות נעות בין Q2_K המצומצם ביותר ועד BF16 המלא, דרך פשרות ביניים נפוצות כמו Q4_K_M ו־Q5_K_M שדורשות פחות זיכרון וידאו.

אם אין לכם כרטיס גרפי חזק עם מספיק VRAM להחזיק מודל של 35B יחד עם ההקשר, או אם המנוע שלכם לא מנצל פענוח ספקולטיבי, עדיף להשתמש ב־API מנוהל חיצוני. ריצה מקומית בלי תמיכה בראשי החיזוי פשוט תבזבז משאבים בלי לתת את תוספת הביצועים.

ollama run hf.co/Jackrong/Qwopus3.6-35B-A3B-v1-MTP-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי, שינוי של הקוד והפצה חוזרת של הקבצים. אתם חופשיים לשלב אותו במוצרים פרטיים או פנימיים, בתנאי שתשמרו על הודעות זכויות היוצרים וכתב הוויתור על אחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗