GPT
K

Keye-VL-8B-Preview

קוד פתוח

Kwai-Keyeapache-2.02025-06-26

  • transformers
  • safetensors
  • Keye
  • feature-extraction
  • multimodal

מודל פתוח של שמונה מיליארד פרמטרים שמתמקד בהבנת וידאו קצר ומשלב מנגנון חשיבה מובנה. הוא מתאים למי שרוצה ניתוח סרטונים מקומי בלי תלות בענן.

  • 8.7Bפרמטרים
  • 40,960טוקנים בהקשר
  • 16.2 GBמשקל הקבצים
  • 21,788הורדות בחודש

מה זה

הארכיטקטורה מחברת בין בסיס השפה של Qwen3-8B למקודד הוויזואלי SigLIP באמצעות שכבת MLP פשוטה. המערכת משתמשת במנגנון 3D RoPE שמקשר בין מיקום הטוקנים לזמן אבסולוטי, מה שמחדד את היכולת לזהות שינויים לאורך ציר הזמן בסרטונים. תהליך האימון התבסס על מעל 600 מיליארד טוקנים בארבעה שלבים, כולל אימון חיזוק עם אלגוריתם GRPO כדי לשפר את שרשרת החשיבה ולצמצם פלט חזרתי.

בבדיקות מול מדדים ציבוריים להבנת וידאו כמו Video-MME ו־TempCompass, הוא מציג יתרון עקבי על פני מודלים פתוחים אחרים במשקל שמונה מיליארד פרמטרים. בנוסף, המפתחים בחנו אותו על מבחן ייעודי שיצרו לסרטונים קצרים בשם KC-MMBench, שם הוא מראה דיוק טוב יותר במשימות שדורשות שילוב בין פרטים ויזואליים מהירים לבין טקסט מורכב על המסך.

מתאים ל

  • תיוג סרטונים קצרים

    ניתוח רצפי תנועה וזיהוי אירועים מהירים בסרטוני רשת מקומיים הודות למנגנון מיפוי הזמן 3D RoPE.

  • פתרון בעיות מתמטיות מתמונות

    מצב החשיבה המובנה עם תמיכה בשרשרת נימוקים מאפשר לו לפרק משוואות וגרפים מורכבים שלב אחר שלב.

  • חילוץ טקסט ויזואלי מצילומים

    אימון המודל כלל דאטה ייעודי למשימות OCR וטבלאות, מה שמסייע לו לחלץ נתונים מתמונות ומסמכים סרוקים.

איפה זה נופל

המודל תומך כרגע בקלט וידאו מקבצים מקומיים בלבד, ואינו מקבל סרטונים ישירות מקישורי רשת. נוסף על כך, ברישומי הכרטיס מצוינת תמיכה בשפה האנגלית בלבד, כך שלא כדאי לבנות עליו לעיבוד תוכן בעברית או להבנת טקסטים מקומיים בתוך הווידאו ללא בדיקה מעמיקה. מדובר בגרסת Preview מוקדמת, והמפתחים אף ציינו במפורש שהיו צריכים להילחם בהתנהגויות של קריסות לפלט חזרתי בלולאות חשיבה.

שאלות
נפוצות

האם אפשר להזין למודל קישור ישיר לסרטון מיוטיוב או מהרשת?

לא. המודל תומך בקלט וידאו מקבצים מקומיים בלבד. בנוסף, ספריות הפענוח decord ו־torchvision מציגות מגבלות תאימות בפרוטוקול HTTPS שתלויות במערכת ההפעלה.

איך שולטים על משך זמן החשיבה של המודל בתשובות?

אפשר להוסיף לפקודת הטקסט את התגיות think/ או no_think/. המנגנון מחליט מתי להפעיל שרשרת חשיבה מעמיקה או לענות ישירות בהתאם להנחיה הזו.

איך מריצים

כדי להריץ אותו צריך להתקין את transformers ישירות ממאגר הגיטהאב ואת חבילת keye-vl-utils. משקל המשקולות עומד על 16.2 גיגה בייט בפורמט bfloat16, כך שצריך כרטיס מסך עם לפחות 24 גיגה בייט זיכרון כדי להחזיק אותו בזיכרון לעיבוד וידאו עם חלון הקשר סביר.

בסביבות שאינן לינוקס, פענוח הווידאו דרך decord מוגבל ונופל לעיבוד דרך torchvision, מה שמשפיע על קריאת קבצים מכתובות רשת ומחייב סרטונים מקומיים בלבד. אם אין ברשותכם חומרה ייעודית כזו ונדרש עיבוד מזדמן בלבד, שימוש ב־API מנוהל יחסוך את עלויות החומרה והתחזוקה המקומית.

from transformers import pipeline

pipe = pipeline("video-text-to-text", model="Kwai-Keye/Keye-VL-8B-Preview")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. הרישיון מאפשר שימוש מסחרי חופשי, שינוי של קוד המקור והפצה מחדש בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של תנאי הרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗