GPT
M

MiroThinker-1.7

קוד פתוח

miromind-aiapache-2.02026-03-09

  • transformers
  • safetensors
  • qwen3_moe
  • text-generation
  • agent

מודל ענק שמיועד לסוכני מחקר מורכבים ולריצות ארוכות במיוחד. הוא מחזיק הקשר של 256K ויודע להפעיל מאות כלי תוכנה ברצף כדי לפצח שאלות עמוקות.

  • 235Bפרמטרים
  • 262,144טוקנים בהקשר
  • 438 GBמשקל הקבצים
  • 137הורדות בחודש

מה זה

מדובר במודל מבוסס תצורת MoE שנבנה ישירות מעל ארכיטקטורת Qwen3, עם משקל כולל של 235 מיליארד פרמטרים. המטרה המרכזית שלו היא ביצוע משימות מחקר עצמאיות הדורשות תכנון רב שלבי, חיפוש, והפעלת כלים חיצוניים שוב ושוב עד שמגיעים למסקנה מבוססת.

המפתחים כיוונו אותו לעבודה של עד 300 קריאות לכלים בכל משימה, טווח שרוב המודלים הרגילים מאבדים בו את הידיים והרגליים. במבחני ביצועים למחקר וגלישה הוא מציג תוצאות חזקות, כולל 74.0% ב־BrowseComp, ציון של 82.7% ב־GAIA-Val-165, ו־75.3% בגרסה הסינית של מבחן הגלישה שבה הוא עוקף מודלים פתוחים אחרים. במבחן הקשה HLE-Text הוא נעצר על 42.9%, נתון שמראה שגם עם חלון עבודה רחב, שאלות מומחה קיצוניות עדיין מאתגרות אותו.

מתאים ל

  • סוכני מחקר אוטונומיים

    מתאים לחיבור מול ספריות דפדפן ומאגרי מידע, לצורך איסוף נתונים שדורש מאות קריאות כלי עוקבות.

  • עיבוד מסמכים באנגלית

    חלון של 256K מאפשר לנתח תיקי מסמכים שלמים בלי צורך בטכניקות קיצוץ או פירוק מסורבלות.

  • אוטומציה של בדיקות עמוקות

    יכולת הסקת המסקנות בשלבים מסייעת להרצת תהליכי בדיקה מורכבים שבהם כל שלב תלוי בתוצאת הקודם.

איפה זה נופל

המגבלה הכי בולטת היא השפה, המודל מוגדר רשמית לאנגלית בלבד, ואין שום תיעוד או בדיקה לגבי תמיכה בעברית. בנוסף, למרות היכולת לבצע מאות קריאות לכלים, המודל מתקשה במשימות היגיון מורכבות במיוחד כפי שמשתקף בציון 42.9% בלבד ב־HLE-Text. שירות ההדגמה של המפתחים עצמם מגביל כל שאילתה ל־100 קריאות בגלל בעיות זמני מענה ויציבות, כך שהרצה מלאה של תהליכים עמוקים גוררת זמני המתנה ארוכים מאוד וסיכון מוגבר לתקיעה באמצע השרשרת.

שאלות
נפוצות

האם אפשר להריץ אותו על שרת יחיד עם כרטיס RTX 4090?

לא. קובצי המשקל בלבד תופסים 438 גיגה בייט בפורמט bfloat16, כך שאי אפשר לטעון אותו אפילו קרוב לזה. תצטרכו שרת ייעודי עם שמונה כרטיסי H100 או A100 כדי להעלות אותו לאוויר.

איך המודל מתמודד עם טקסטים בעברית?

החומר הרשמי מציין תמיכה בשפה האנגלית בלבד, לצד בדיקות ספציפיות בסינית. לא מומלץ לבנות עליו לעיבוד שפה טבעית בעברית בלי לבצע בדיקות מקדימות, כי הוא עלול להחזיר פלט משובש.

למה המפתחים מגבילים את הדמו ברשת ל־100 קריאות כלי?

משימות מחקר רחבות דורשות לעיתים מעל 200 קריאות, מה שמייצר עומס כבד וזמני המתנה של דקות ארוכות. ההגבלה נועדה לשמור על שרת הדמו יציב, אבל בהרצה עצמאית המודל מסוגל להגיע עד ל־300 קריאות.

איך מריצים

כדי להריץ מפלצת של 438 גיגה בייט בקבצים, תצטרכו שרת עם שמונה כרטיסי מסך חזקים במקביל, כפי שמומלץ בפקודות ההרצה של SGLang או vLLM עם tensor parallel של 8. המודל דורש זיכרון וידאו עצום רק כדי להיטען, עוד לפני שמנצלים את מלוא חלון ה־256K טוקנים.

מי שאין לו קלאסטר כזה יכול להשתמש בגרסת ה־30B הקטנה יותר, או פשוט לפנות לשירות הרשת שהמפתחים מציעים. אם אתם צריכים את המודל למוצר מסחרי ולא רוצים לשלם אלפי דולרים בחודש על שרת ייעודי, עדיף להמתין לספקי ענן שיציעו גישה אליו לפי טוקן.

from transformers import pipeline

pipe = pipeline("text-generation", model="miromind-ai/MiroThinker-1.7")
print(pipe("שלום"))

הקבצים

106 קבצים במאגר, 438 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקולות שוחררו ברישיון Apache 2.0 מלא. אפשר להשתמש במודל לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים פנימיים או למכור שירותים שמבוססים עליו, בלי לשלם תמלוגים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗