GPT
K

Keye-VL-2.0-30B-A3B

קוד פתוח

Kwai-Keyeapache-2.02026-05-25

  • transformers
  • safetensors
  • KeyeVL2
  • feature-extraction
  • multimodal

מודל מולטימודלי של 31 מיליארד פרמטרים עם ארכיטקטורת תערובת מומחים, שמיועד לניתוח סרטוני וידאו ארוכים ומגיע עם חלון הקשר עצום של 256 אלף טוקנים.

  • 31Bפרמטרים
  • 262,144טוקנים בהקשר
  • 58.0 GBמשקל הקבצים
  • 656הורדות בחודש

מה זה

הייחוד המרכזי כאן הוא התמודדות עם וידאו ארוך בלי לאבד את הידיים והרגליים. בזמן שרוב המודלים מתעייפים ומאבדים דיוק ככל שמעמיסים עליהם פריימים, המבחנים מראים שהביצועים שלו דווקא משתפרים במעבר מ־64 פריימים ל־512 פריימים. במדדי איתור זמני של אירועים בתוך סרטונים כמו QVHighlights הוא עוקף מודלים סגורים חזקים בהרבה, מה שהופך אותו לבחירה חריגה למי שצריך להצביע על נקודת זמן מדויקת בצילום.

בנוסף לווידאו, הוא כולל יכולות מובנות להפעלת כלים, חיפוש ברשת וקוד. המבנה שלו מבוסס על מנגנון קשב דליל בשם DeepSeek Sparse Attention, שמאפשר לו לעכל הקשרים ענקיים בלי לטחון זיכרון וחישוב בקצב של מודלים צפופים רגילים.

מתאים ל

  • איתור אירועים בווידאו ארוך

    מזהה נקודות זמן מדויקות לאורך שעות של צילום, מעולה לסריקת הקלטות אבטחה או ארכיונים.

  • ניתוח מסמכים ותרשימים

    מפענח טבלאות וגרפים מורכבים בזכות שיפורים ייעודיים במנגנון התפיסה החזותית.

  • סוכנים מולטימודליים

    מריץ קריאות לממשקי תוכנה וחיפוש ברשת תוך כדי עיבוד קלט חזותי שוטף.

איפה זה נופל

המודל מוגדר רשמית לדוברי אנגלית בלבד, כך שאי אפשר לבנות עליו לעיבוד מסמכים או שיחות בעברית בלי לצפות להזיות. בעיה נוספת היא התלות הכבדה במימושים מותאמים אישית. הוא לא נתמך מהקופסה במנועי הרצה סטנדרטיים, אלא מחייב ענף ספציפי של SGLang וקרנלים ייעודיים כדי שהארכיטקטורה תעבוד. בנוסף, חלון ההקשר הגדול אומנם נתמך, אבל מילוי של 256 אלף טוקנים ידרוש משאבי זיכרון קיצוניים גם עם מנגנון הקשב הדליל.

שאלות
נפוצות

אפשר להריץ את המודל על כרטיס RTX 4090 בודד?

לא. המשקלים לבדם שוקלים 58 גיגה בייט, ובשביל מנגנוני הריצה וההקשר הארוך היצרן דורש שרת עם לפחות שני כרטיסי H800. תצטרכו חומרת שרתים מתקדמת.

הוא מתאים לקריאת מסמכים בעברית?

הכרטיס מצהיר על תמיכה באנגלית בלבד. כל ניסיון להזין לו עברית יוביל לפענוח שגוי של תווים ואי דיוקים בתשובות.

איך מריצים

כדי להריץ 58 גיגה בייט של משקלים עם ארכיטקטורת מומחים וחלון ענק, תצטרכו חומרה רצינית מאוד ברמת דאטה סנטר. ההוראות הרשמיות דורשות שרת עם שני כרטיסי H800 במקביל ושימוש בגרסה ייעודית של SGLang יחד עם קרנלים מותאמים אישית כמו DeepGEMM.

ההתקנה ידנית ומסורבלת, עם תלויות מקומיות שדורשות הידור. אם אין לכם אשכול ייעודי של כרטיסי אנבידיה מהדרג העליון וסביבת דוקר מסודרת, אין טעם לנסות להרים את זה עצמאית במשרד.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Kwai-Keye/Keye-VL-2.0-30B-A3B")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 סטנדרטי. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהטמיע אותו במוצרים פנימיים או חיצוניים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗