GPT
K

Kimi-VL-A3B-Instruct

קוד פתוח

moonshotaimit2025-04-09

  • transformers
  • safetensors
  • kimi_vl
  • feature-extraction
  • agent

מודל ראייה ושפה מבוסס תערובת מומחים שמפעיל רק כ־3 מיליארד פרמטרים בכל שלב. הוא מיועד למי שצריך לפענח מסמכים ארוכים, סרטונים או מסכי ממשק בלי לחנוק את החומרה.

  • 16Bפרמטרים
  • 131,072טוקנים בהקשר
  • 30.6 GBמשקל הקבצים
  • 171,288הורדות בחודש

מה זה

במקום לחשב את כל 16 מיליארד הפרמטרים בכל טוקן, המודל משתמש בארכיטקטורת תערובת מומחים שמפעילה רק 2.8 מיליארד פרמטרים במודל השפה ועוד 0.4 מיליארד ברכיב הראייה. החיבור הזה מאפשר לו לעבד תמונות ברזולוציה מקורית לצד חלון הקשר נרחב של 128 אלף טוקנים, כך שהוא קורא קובצי וידאו ארוכים ומסמכים מרובי עמודים במהירות של מודל קטן בהרבה.

במבחני ביצועים הוא עוקף מודלים צפופים בעלי משקל דומה ואף גדול יותר. במשימות זיהוי תווים וניתוח גרפי בסיסי הוא הציג תוצאות גבוהות כמו 83.2 ב־InfoVQA ו־867 ב־OCRBench, כשהוא מתעלה במקומות מסוימים אפילו על GPT-4o. החוזק העיקרי שלו מול המתחרים בקטגוריה מתבטא בהבנת ממשקים גרפיים ובאיתור רכיבים על גבי מסכים עם דיוק של 92.8 במבחן ScreenSpot-V2.

מתאים ל

  • זיהוי אלמנטים בצילומי מסך

    מתאים לסוכני ממשק שצריכים לאתר כפתורים ואזורי לחיצה בתמונות רזולוציה גבוהה.

  • חילוץ נתונים ממסמכים וקבלות

    טוב לפענוח תמונות סרוקות ודיאגרמות בזכות רכיב הראייה המקורי וציוני OCR גבוהים.

  • תחקור קובצי וידאו ארוכים

    מאפשר לשאול שאלות על ציר זמן רחב בזכות חלון של 128 אלף טוקנים וארכיטקטורה יעילה.

איפה זה נופל

למרות ההבטחות בתחום הממשקים, במבחני תפעול מערכת מציאותיים ומורכבים כמו OSWorld הוא השיג ציון של 8.22 בלבד, שזה שיפור מול מתחרים קטנים אך עדיין נמוך מכדי לתת לו לנהל משימות מחשב עצמאיות ללא השגחה. במתמטיקה מורכבת מבוססת ראייה הוא נשאר מאחור עם 21.4 במבחן MathVision, חלש משמעותית ממודלים כמו Gemma3-12B-IT. בנוסף, חלון ההקשר הגדול מעמיס מאוד על הזיכרון בעת הזנת וידאו מלא או מסמכים של עשרות עמודים, והדיוק צונח במסמכים ארוכים ל־35.1 בלבד ב־MMLongBench-Doc. אין בתיעוד שום מידע על תמיכה או ביצועים בעברית.

אותה משפחה

Kimi-VL יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל ירוץ בצורה חלקה על כרטיס מסך בודד של 24 גיגה?

לא בגרסתו המקורית. קובצי המודל שוקלים מעל 30 גיגה ב־bfloat16 ולכן הם דורשים כרטיס עם נפח זיכרון גדול יותר כמו A100 של 40 או 80 גיגה. אפשר להריץ אותו על חומרה צרכנית רק אם מבצעים קוונטיזציה למשקלים או מפצלים את המודל על פני שני כרטיסים.

מה ההבדל בין גרסת Instruct לגרסת Thinking?

גרסת Instruct מכוילת למענה תמציתי ויעיל, OCR, עיבוד וידאו ואינטראקציה של סוכנים, ומומלץ להריץ אותה בטמפרטורה נמוכה של 0.2. גרסת Thinking אומנה בשיטות שרשרת חשיבה ולמידת חיזוק, והיא עדיפה למשימות הדורשות פתרון בעיות מתמטיות והיגיון מעמיק.

איך מריצים

כדי להריץ אותו מקומית ב־bfloat16 צריך כרטיס מסך עם לפחות 40 גיגה זיכרון גרפי, כמו A100 או זוג כרטיסי 24 גיגה, מפני שהמשקלים לבדם תופסים מעל 30 גיגה בזיכרון לפני חישובי ההקשר. הסביבה הנתמכת דורשת פייתון 3.10, ספריית transformers בגרסה 4.48.2 ו־PyTorch מגרסה 2.1.0 ומעלה. התמיכה ב־vLLM עדיין תלויה במיזוג פיתוח ולא קיימת בגרסה הרשמית היציבה.

אם אתם צריכים בעיקר יכולות פתרון בעיות מתמטיות מורכבות או הסקת מסקנות בשלבים, היוצרים ממליצים לבחור בגרסת ה־Thinking ולא בגרסת ה־Instruct הזו. כשאין ברשותכם כרטיס מקצועי ייעודי לעומסי זיכרון כאלה, פנייה לממשק מרוחק תחסוך את עלויות החומרה וההתקנה המורכבת.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="moonshotai/Kimi-VL-A3B-Instruct")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו ברישיון MIT. המשמעות היא חופש פעולה מלא, כולל שימוש מסחרי, שינוי הקוד, הפצה מחדש והטמעה במוצרים סגורים. התנאי היחיד הוא השארת הודעת זכויות היוצרים ונוסח הרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗