GPT
K

Kimi-VL-A3B-Thinking-2506

קוד פתוח

moonshotaimit2025-06-21

  • transformers
  • safetensors
  • kimi_vl
  • feature-extraction
  • image-text-to-text

מודל ויזואלי של 16 מיליארד פרמטרים שמשלב תהליך חשיבה ארוך לפני מתן תשובה. הוא מיועד למי שצריך פירוק מעמיק של תרשימים, בעיות מתמטיות או פעולות ממשק במקום שליפה מיידית.

  • 16Bפרמטרים
  • 131,072טוקנים בהקשר
  • 30.6 GBמשקל הקבצים
  • 31,602הורדות בחודש

מה זה

מדובר בעדכון לגרסת החשיבה הקודמת של Moonshot, שמתמקד בפתרון בעיות ויזואליות שדורשות שלבי ביניים. במקום לענות מיד מה מופיע בתמונה, המודל מייצר שרשרת חשיבה פנימית שיכולה להגיע עד 32 אלף טוקנים. השיפור המרכזי בגרסה הזו הוא צמצום של כעשרים אחוז באורך שרשרת החשיבה לצד קפיצה משמעותית בדיוק, במיוחד בחישובים וקריאת גרפים, לצד תמיכה בתמונות חדות יותר של עד 3.2 מיליון פיקסלים.

במבחני ביצועים מתמטיים כמו MathVision הוא מזנק לציון 56.9 לעומת 36.8 בגרסה הקודמת, ואף עוקף מודלים פתוחים כבדים בהרבה כמו Qwen2.5 בגרסאות 32 ו־72 מיליארד פרמטרים. המשמעות בפועל היא יכולת טובה משמעותית בניתוח תותבות ויזואליות, פתרון משוואות מתוך תמונה, זיהוי אלמנטים על גבי מסך מחשב וסרטוני וידאו, תחומים שבהם מודלים מהירים בדרך כלל מנחשים.

מתאים ל

  • פתרון בעיות במתמטיקה וגרפים

    מצטיין בניתוח נתונים ותרשימים מורכבים בזכות שיפור משמעותי במבחני MathVision ויכולת הסקת מסקנות בשלבים.

  • אוטומציה וניווט בממשקי מחשב

    רזולוציה גבוהה של 3.2 מיליון פיקסלים מאפשרת לו לאתר כפתורים ואלמנטים קטנים ברמת דיוק טובה מול מסכים מלאים.

  • ניתוח מסמכים ארוכים וסרטונים

    חלון של 131 אלף טוקנים ותמיכה בהבנת וידאו מאפשרים לסרוק קבצים עמוסים ולחלץ מידע שדורש הצלבת עמודים שונים.

איפה זה נופל

בגלל אופי הפיענוח הארוך, זמן התגובה הראשוני איטי משמעותית ממודלים רגילים. זה הופך אותו ללא מתאים לצ'אט בזמן אמת, ממשקים שדורשים פידבק מיידי או בדיקות פשוטות של זיהוי אובייקטים. במבחנים מסוימים כמו ScreenSpot-V2 הגרסה הזו ירדה קלות מציון 92.8 ל־91.4 לעומת גרסת ה־Instruct, ובמבחן GPQA-Diamond שבודק שאלות מדעיות ברמת דוקטורט הוא מקבל 42.3, פחות מהמתחרים המקבילים בקטגוריה.

שאלות
נפוצות

למה לבחור בו במקום בגרסת Instruct הרגילה?

אם אתם צריכים תשובות לשאלות ישירות או תיאור תמונה קצר, גרסת ה־Instruct תהיה מהירה וזולה בהרבה. גרסת החשיבה מיועדת אך ורק למקרים שבהם המודל צריך לחשב צעדים, לפתור שאלות הגיון ויזואליות או לפענח ממשקים מורכבים.

האם אפשר להריץ אותו על מחשב אישי עם כרטיס בודד?

לא בהגדרות המקוריות. קבצי המודל שוקלים מעל שלושים גיגה בייט, ובשילוב שרשראות החשיבה הארוכות שצורכות זיכרון נוסף תזדקקו לכרטיס מקצועי של 40 גיגה בייט ומעלה, או להמתין לגרסאות מכווצות בקוונטיזציה.

איך מריצים

המשקלים דורשים כ־31 גיגה בייט על הדיסק, ובדיוק המקורי של bfloat16 תצטרכו כרטיס עם לפחות 40 גיגה בייט זיכרון גרפי, דוגמת A100 או זוג כרטיסי 24 גיגה בייט, רק כדי לטעון אותו עם הקשר בסיסי. בגלל שהמודל יכול לפלוט שרשראות חשיבה ארוכות של עד 32 אלף טוקנים ומחזיק חלון הקשר של 131 אלף טוקנים, דרישות הזיכרון לניהול ה־KV Cache מתנפחות מהר מאוד בהרצה חיה.

היוצרים ממליצים להריץ אותו דרך vLLM בגרסה 0.9.1 יחד עם flash-attn כדי לא לקבל שגיאות חוסר זיכרון ב־CUDA. אם אין לכם שרת ייעודי זמין עם מאיץ מתאים, הרצה מקומית תהיה איטית ויקרה מדי, ועדיף להשתמש בנקודת קצה מנוהלת או שירות ענן לפי שעה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="moonshotai/Kimi-VL-A3B-Thinking-2506")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד, לאמן על גביו, לשלב אותו בתוך מוצרים סגורים ולהפיץ אותו בחופשיות. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית וכתב הוויתור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗