GPT
Q

Sehyo/Qwen3.5-122B-A10B-NVFP4

קוד פתוח

Sehyoרישיון לא דווח2026-02-25

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • quantized

גרסה מכווצת בפורמט NVFP4 של מודל תמונה וטקסט גדול, עם תמיכה ביצירת טוקנים מואצת. היא מיועדת למי שרוצה להריץ מודל ענק מקומית בלי לחנוק את הזיכרון לחלוטין.

  • 71Bפרמטרים
  • 262,144טוקנים בהקשר
  • 75.9 GBמשקל הקבצים
  • 48,935הורדות בחודש

מה זה

מדובר בהמרה של המודל המקורי באמצעות כלי הדחיסה של vLLM לפורמט NVFP4, שמיועד לחומרה מודרנית שיודעת לעבוד עם דיוק של ארבע ביט. הארכיטקטורה כאן היא תערובת מומחים עם מעל שבעים מיליארד פרמטרים בפועל, כשהתהליך כויל על חמש מאות ושנים עשר דוגמאות ממאגרי צ'אט כדי לוודא שכל המומחים עברו התאמה ולא נשחקו בדחיסה.

המודל מעבד גם טקסט וגם תמונה, מגיע עם תמיכה מובנית בניבוי מרובה טוקנים לצורך פענוח ספקולטיבי, ופותח חלון הקשר עצום של מאתיים שישים ושניים אלף טוקנים. השילוב הזה נותן יכולת לקרוא מסמכים ארוכים או סדרות תמונות בלי לאבד את ההקשר המוקדם, כל עוד החומרה מחזיקה את המעמסה.

מתאים ל

  • ניתוח מסמכים ותמונות

    חיבור ישיר בין פלט ויזואלי להבנת טקסט בהיקף גדול על חומרה מקומית.

  • שרת הסקה עם שיהוי נמוך

    משקלי הניבוי המרובה מאפשרים פענוח ספקולטיבי שמאיץ את פליטת הטוקנים.

  • סריקת טקסטים ארוכים

    הקשר של מעל מאתיים אלף טוקנים מתאים לעבודה עם תיעוד טכני כבד.

איפה זה נופל

הכיול נעשה על אורך רצף מקסימלי של ארבעת אלפים טוקנים בלבד, למרות שהמודל תומך על הנייר במאתיים שישים ושניים אלף טוקנים. זה אומר שבשיחות ארוכות או בעיבוד מסמכי ענק הוא עלול לאבד דיוק ולהתנהג פחות טוב מאשר בטקסטים קצרים. בנוסף, קוונטיזציה של ארבע ביט פוגעת לעיתים ביכולות היגיון עדינות, ודפי המודל לא מציגים מבחני ביצועים שמראים כמה איכות אבדה במעבר מהמקור.

שאלות
נפוצות

האם אפשר להריץ אותו על ספריות רגילות ללא התאמות?

לא. הכרטיס מציין במפורש שחובה להשתמש בגרסת לילה של vLLM, והדחיסה נשענת על תוספות קוד חדשות במנוע הדחיסה. בלי הסביבה המדויקת הזו הקבצים לא ייטענו.

האם כדאי להשתמש בו למוצר מסחרי כרגע?

לא מומלץ בכלל. מעבר להיעדר מוחלט של רישיון שימוש מוגדר, מדובר בהמרה לא רשמית שלא מפרסמת מדדי איכות ביחס למקור, כך שאין שום דרך לדעת מה נהרס בדרך.

איך מריצים

כדי להריץ אותו בפועל צריך כרטיסי מסך שתומכים בהרצת NVFP4 וגרסת פיתוח עדכנית של vLLM, כי גרסאות יציבות ישנות יותר פשוט לא יזהו את הפורמט. הקבצים עצמם שוקלים כמעט שבעים ושישה ג'יגה בייט, כך שאתם צריכים לפחות מאה ג'יגה בייט של זיכרון וידאו פנוי רק כדי לטעון אותו ולהשאיר מקום להקשר סביר.

אם אין לכם שרת ייעודי עם חומרה תואמת מהדורות האחרונים, אין טעם להסתבך עם התקנה מקומית. במקרה כזה עדיף לשלם לפי שימוש לספק שמחזיק את המודל המקורי בנקודת קצה מסודרת, במקום לשרוף שעות על קינפוג תלויות.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Sehyo/Qwen3.5-122B-A10B-NVFP4")
print(pipe("שלום"))

הרישיון

היוצר לא פרסם שום רישיון במאגר. מבחינה משפטית זה אומר שאין לכם היתר שימוש ברור, לא לצרכים מסחריים ולא לפיתוח פנימי בחברה. כל עוד הרישיון לא מוגדר, שילוב של הקבצים האלה במוצר חושף אתכם לסיכון של הפרת זכויות יוצרים, ועדיף לבדוק קודם את תנאי המקור של קוון לפני שנוגעים בהם.

הרישיון המלא בעמוד המודל ↗