GPT
K

Kimi-VL-A3B-Thinking

קוד פתוח

moonshotaimit2025-04-09

  • transformers
  • safetensors
  • kimi_vl
  • feature-extraction
  • image-text-to-text

זה מודל ראייה ושפה שמשלב הסקת מסקנות ארוכה עם ארכיטקטורת מומחים חסכונית. מורידים אותו כשרוצים לנתח תמונות ותרשימים מתמטיים מורכבים בלי לשלם עלויות הרצה של מודל ענק.

  • 16Bפרמטרים
  • 131,072טוקנים בהקשר
  • 30.6 GBמשקל הקבצים
  • 18,653הורדות בחודש

מה זה

מדובר במודל ראייה ושפה שמשתמש בארכיטקטורת תערובת מומחים. למרות שיש לו 16.4 מיליארד פרמטרים בסך הכול, הוא מפעיל רק 2.8 מיליארד בכל שלב של מפענח השפה. החלק הייחודי בגרסה הזו הוא שרשרת חשיבה ארוכה שנבנתה בעזרת אימון מונחה ולמידת חיזוק, מה שמביא אותו להתעמק בשאלות מולטימודליות במקום לשלוף תשובה מידית.

במבחני ביצועים מול תרשימים ובעיות מתמטיקה חזותית, הוא עומד יפה מול מתחרים גדולים בהרבה. ב־MathVision הוא הגיע לציון 36.8 וב־MathVista ל־71.3, מספרים שעוקפים מודלים צפופים כמו Qwen2.5-VL-7B ו־Gemma-3-12B, ומשתווים למודלים עם עשרות מיליארדי פרמטרים. עם זאת, במבחן הידע האקדמי הכללי MMMU הוא משיג 61.7, שזה פחות טוב מ־GPT-4o או מודלים ענקיים של 72B.

מתאים ל

  • פתרון בעיות גיאומטריה ותרשימים

    מפענח משוואות וגרפים מורכבים מתוך תמונות בעזרת שרשרת חשיבה מעמיקה וציונים גבוהים במבחני מתמטיקה.

  • ניתוח מסמכים חזותיים ארוכים

    חלון הקשר של 128K טוקנים ומנגנון MoonViT מתמודדים היטב עם קבצים מרובי עמודים ברזולוציה מקורית.

  • משימות סוכנים בממשקים גרפיים

    מנתח צילומי מסך של מערכות הפעלה ומחזיר פעולות לאחר תהליך הסקה על מיקום האלמנטים.

איפה זה נופל

החיסרון המרכזי שמופיע בראש העמוד הוא שכבר קיימת לו גרסה חדשה יותר בשם Kimi-VL-A3B-Thinking-2506, והיוצרים עצמם ממליצים להעדיף אותה על פני הגרסה הזו בכל תרחישי ההסקה, הווידאו והסוכנים. בנוסף, מודל חשיבה עם טמפרטורה גבוהה של 0.8 מייצר שרשראות טקסט ארוכות מאוד לפני שהוא פולט תשובה סופית, מה שאומר זמני תגובה ארוכים ועלות טוקנים גבוהה על פלט. במבחן הידע האקדמי MMMU הוא פחות מרשים, כך שלא הייתי סומך עליו לניתוח חזותי של תחומים שדורשים ידע עולם רחב מעבר לפתרון בעיות טכניות ומתמטיות.

אותה משפחה

Kimi-VL יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם שווה להוריד את המודל הזה כשיש כבר גרסה 2506?

אם אתם מתחילים פרויקט חדש עכשיו, אין סיבה לבחור בגרסה הזו. המפתחים כתבו בפירוש שגרסת 2506 עדיפה בהבנה חזותית, וידאו, והפעלת סוכנים.

למה צריך כרטיס מסך חזק אם הוא מפעיל רק 2.8B פרמטרים?

ארכיטקטורת MoE מפעילה מעט פרמטרים בכל שלב חישוב, אבל כל 16 מיליארד הפרמטרים חייבים לשבת בזיכרון ה־VRAM בו זמנית. אי אפשר לטעון רק חלק מהמשקלים, ולכן תצטרכו לפחות 32 עד 40 גיגה זיכרון כרטיס מסך כדי להריץ אותו.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־30.6 גיגה־בייט בדיוק של bfloat16. כדי להעלות את כל 16 מיליארד הפרמטרים לזיכרון תצטרכו כרטיס מסך עם לפחות 40 גיגה זיכרון גרפי, כמו A100 או זוג כרטיסים צנועים יותר, גם אם החישוב בפועל רץ רק על חלק קטן מהם בכל רגע נתון. המפתחים ממליצים להריץ אותו בסביבת Python 3.10 עם transformers בגרסה 4.48.2 ו־PyTorch מגרסה 2.1.0 ומעלה, ובנוסף הגישו בקשת מיזוג להרצה תחת vLLM.

המפתחים מדגישים שכדי שהמודל יבצע חשיבה ארוכה כמו שצריך, יש להגדיר טמפרטורה של 0.8 בזמן הריצה, בניגוד לגרסת Instruct שדורשת 0.2. למשימות שדורשות תגובה מיידית בלי תהליך פתרון מפורט, עדיף להשתמש בגרסת Instruct ולא בגרסת החשיבה הזו.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="moonshotai/Kimi-VL-A3B-Thinking")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון MIT. זה הרישיון הכי מתירני שיש, ומותר לקחת את המודל, לשנות אותו, להטמיע אותו בתוך מערכת סגורה ולמכור גישה אליו בלי תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד או בהפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗