GPT
I

Intern-S1-mini

קוד פתוח

internlmapache-2.02025-08-18

  • transformers
  • safetensors
  • interns1
  • text-generation
  • image-text-to-text

מודל מולטימודלי קומפקטי שנבנה סביב נתונים מדעיים, ומציע יכולות חשיבה וניתוח של נוסחאות כימיות ותמונות. מתאים למי שצריך ביצועים חזקים במדעים בלי להחזיק שרת ענק.

  • 8.5Bפרמטרים
  • 65,536טוקנים בהקשר
  • 15.9 GBמשקל הקבצים
  • 10,520הורדות בחודש

מה זה

הבסיס כאן מחבר מודל שפה של 8 מיליארד פרמטרים מבית Qwen3 יחד עם מקודד תמונה קטן של 0.3 מיליארד פרמטרים. האימון המקדים עבר על חמישה טריליון טוקנים, כאשר יותר מחצי מהם הגיעו ישירות מתכנים מדעיים. השילוב הזה נותן לו טוקנייזר שמפרק ומבין מבנים מולקולריים ורצפי חלבונים כחלק מהשפה הטבעית שלו ולא כטקסט שבור.

במבחני ביצועים רואים היטב את המיקוד הזה. במתמטיקה ברמת תחרויות כמו AIME2024 הוא מגיע לציון של 84.58, ובמבחנים כימיים כמו ChemBench הוא עומד על 76.47, תוצאות שגוברות בבירור על מודלים מקבילים בגזרת השמונה מיליארד. במבחני שפה כלליים וראייה ממוצעת הוא עדיין שומר על רמה תחרותית, אבל היתרון האמיתי מורגש ברגע שמציגים לו בעיה חישובית או מדעית סבוכה.

מתאים ל

  • ניתוח מולקולות ותרכובות

    הוא אומן על מיליארדי טוקנים מדעיים ומזהה ישירות מבנים כימיים ונוסחאות.

  • פתרון בעיות מתמטיקה מתקדמות

    התוצאות במבחני AIME מראות יכולת חשיבה והסבר עמוקה ביחס למודלים של 8B.

  • שרת מקומי עם קריאות כלים

    תומך בחיבור לכלי צד שלישי ובממשק תואם OpenAI דרך vLLM או LMDeploy.

איפה זה נופל

למרות ההצלחה במתמטיקה תיאורטית, המודל מתקשה בחלק ממשימות הראייה המדעיות והגרפיות. במבחן MathVista הוא קיבל ציון של 70.3 בלבד, נמוך יותר ממתחרים כמו GLM-4.1V שהגיעו מעל 80, ובמבחן SFE הוא נעצר ב־35.84. בנוסף, משימות וידאו דורשות משאבי חומרה כפולים ומורכבות יותר להרצה יציבה.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב נייד רגיל?

לא מומלץ בלי חומרה מתאימה. המשקל שלו דורש כרטיס מסך ברמה של A100 להרצה מלאה, או שרת מקומי דרך Ollama על חומרה חזקה.

איך מבטלים את מצב הניתוח הארוך כדי לקבל תשובות מהירות?

מעבירים את הפרמטר enable_thinking כערך שלילי בתוך תבנית הצ'אט או בקריאת ה־API. זה יחסוך טוקנים ויחזיר תשובה ישירה בלי פירוט שלבי החשיבה.

איך מריצים

כדי להריץ את גרסת הדיוק המקורית תצטרכו כרטיס מקצועי בודד כמו A100, H100 או H200. קיימת גם גרסת FP8 שדורשת פחות משאבים ומסוגלת לרוץ על גבי H800 ומעלה. אם רוצים להזין קטעי וידאו, המפתחים מציינים שצריך לפחות שני כרטיסי מסך יחד עם ספריית decord כדי להימנע מנפילות זיכרון.

ההטמעה בפועל פשוטה ועוברת דרך transformers, vLLM, SGLang, או שרת מקומי ב־Ollama. המודל כולל מצב חשיבה שפועל כברירת מחדל ומשפר את איכות ההסבר, אך ניתן לכבות אותו דרך הפרמטרים אם רוצים תגובה מהירה וזולה יותר.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="internlm/Intern-S1-mini")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו באופן מסחרי, לשנות את הקוד ולהפיץ אותו בתוך מוצרים סגורים. הדרישה היחידה היא לשמור על הודעת זכויות היוצרים ועל נוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗