GPT
K

Keye-VL-1_5-8B

קוד פתוח

Kwai-Keyeapache-2.02025-08-26

  • transformers
  • safetensors
  • KeyeVL1_5
  • feature-extraction
  • multimodal

מודל ראייה פתוח שמיועד לפענוח וידאו ממושך והסקה לוגית. החוזק שלו הוא עיבוד וידאו מורכב עם חלון של 128 אלף טוקנים בלי לקרוס תחת העומס.

  • 8.7Bפרמטרים
  • 131,072טוקנים בהקשר
  • 16.2 GBמשקל הקבצים
  • 14,392הורדות בחודש

מה זה

מדובר במודל שמשלב שפה וראייה ומבוסס על Qwen3-8B יחד עם מקודד תמונה מסוג SigLIP. כדי להתמודד עם וידאו ארוך בלי לחנוק את הזיכרון, הוא משתמש בשיטת SlowFast שמנתחת מעט פריימים ברזולוציה מלאה והרבה פריימים ברזולוציה נמוכה יותר, לצד חלוקה לטלאים ושילוב שכבת מיפוי בסיסית.

התוצאה של הארכיטקטורה הזו מתבטאת בביצועים חזקים במבחני וידאו כמו Video-MME ו־LongVideoBench, שבהם הוא מציג יכולת מעקב אחרי רצפים בזמן שאינם זמינים ברוב המודלים בגודל 8 מיליארד פרמטרים. בנוסף, האימון כלל חיזוק ייעודי לחשיבה מתמטית ופתרון בעיות, מה שמקפיץ את התוצאות במבחנים לוגיים כמו WeMath.

מתאים ל

  • תחקור סרטוני וידאו ארוכים

    חלון של 128 אלף טוקנים וארכיטקטורת SlowFast מאפשרים מעקב מדויק אחרי התרחשויות על ציר זמן רחב.

  • פתרון בעיות ויזואליות במדעים

    אימון המודל הותאם במיוחד לניתוח תרשימים ומשוואות במבחני חשיבה כמו WeMath ו־MathVerse.

  • חיפוש מבוסס ראייה במאגרים

    התאמת המודל למערכות RAG מאפשרת שליפת פרטים מדויקים מתוך קובצי מדיה ומסמכים מורכבים.

איפה זה נופל

המודל מוגדר רשמית לאנגלית בלבד, ואין שום מידע על תמיכה או ביצועים בעברית. שימוש בעברית עלול לייצר פלט משובש או הזיות. בנוסף, חלון הקשר ענק בווידאו דורש משאבי חישוב עצומים ועלול להוביל לזמני תגובה איטיים מאוד בהרצה מקומית צנועה.

שאלות
נפוצות

האם אפשר לעבוד איתו בעברית?

התיעוד מציין תמיכה בשפה האנגלית בלבד. לא כדאי לבנות עליו לפרויקטים בעברית בלי לבצע בדיקות מקיפות או כוונון עדין מראש.

מה המשמעות של ארכיטקטורת SlowFast בשימוש יומיומי?

השיטה חוסכת משאבים על ידי שילוב של פריימים איכותיים לזיהוי פרטים לצד פריימים ברזולוציה נמוכה לתנועה, מה שמאפשר לנתח סרטונים ארוכים בלי לחרוג מזיכרון הכרטיס.

איך מריצים

במשקל של 16.2 גיגה בייט בפורמט bfloat16, המודל דורש כרטיס מסך בודד עם 24 גיגה בייט זיכרון להסקה פשוטה, אבל כדי לנצל את חלון ההקשר המלא של 128 אלף טוקנים עם וידאו כבד תצטרכו שרת עם מספר מאיצים.

המפתחים ממליצים להרים אותו ישירות מעל vLLM בעזרת חבילת העזר keye-vl-utils. אם אין לכם חומרת שרתים מקומית זמינה וקבועה, פריסה עצמית כזו תעלה לא מעט, ובמקרים של עומס לא רציף עדיף לחכות לחלופות ענן מנוהלות.

from transformers import pipeline

pipe = pipeline("video-text-to-text", model="Kwai-Keye/Keye-VL-1_5-8B")
print(pipe("שלום"))

הרישיון

הפצה תחת רישיון Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהטמיע אותו במוצרים סגורים, בתנאי ששומרים על הודעת זכויות היוצרים המקורית והצהרת הוויתור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗