GPT
I

II-Search-4B

קוד פתוח

Intelligent-Internetapache-2.02025-08-05

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • conversational

מודל שפה קומפקטי שמכוון ספציפית לחיפוש מידע ברשת והרכבת תשובות מרובות שלבים. הוא מיועד למי שרוצה סוכן חוקר עצמאי בלי לגרור משקלים של עשרות מיליארדי פרמטרים.

  • 4.4Bפרמטרים
  • 98,304טוקנים בהקשר
  • 8.2 GBמשקל הקבצים
  • 91הורדות בחודש

מה זה

הבסיס כאן הוא Qwen3-4B, אבל הוא עבר אימון ייעודי שכלל זיקוק ממודל ענק של 235 מיליארד פרמטרים וחיזוק בלמידת חיזוק מול מאגרי מידע. המטרה הברורה שלו היא לא לכתוב שירים, אלא להפעיל כלים, לקרוא דפי אינטרנט ולהצליב עובדות לפני שהוא עונה.

במבחנים כמו SimpleQA הוא מגיע לציון של 91.8 לעומת 76.8 של מודל הבסיס, ובמבחן Frames המורכב הוא מכפיל את התוצאה שלו. המספרים האלה מראים שהוא לא מנחש, אלא יודע לעצור, לבצע בממוצע כשתי שאילתות חיפוש ולבקר ביותר משלושה אתרים כדי לחלץ עובדות מבוססות.

מתאים ל

  • סוכן בדיקת עובדות

    אימות נתונים והצלבת מקורות בזכות אימון ייעודי לחיפוש רב שלבי ברשת.

  • מחקר ודוחות אוטומטיים

    איסוף מידע מכמה אתרים במקביל וסיכום התוכן למסמך עובדתי אחד.

  • בוט תשובות מבוסס רשת

    מענה מדויק על שאלות ידע מורכבות תוך הפעלת מנוע חיפוש בזמן אמת.

איפה זה נופל

אם תנתקו אותו מהאינטרנט או מכלי חיפוש, איבדתם כמעט את כל היתרון שלו על פני מודלים כלליים אחרים. הוא אומן לחפש, ולכן ללא הזנת מקורות עדכניים הוא עדיין מוגבל לידע הבסיסי שלו. בנוסף, מודל של 4.4 מיליארד פרמטרים עלול להיתקע בלולאות של קריאות לכלים או לחלץ מידע שגוי מדפים עמוסים מדי, כך שחובה להגדיר לו מגבלת צעדים קשיחה בקוד לפני שמשחררים אותו למשתמשי קצה.

שאלות
נפוצות

האם הוא יכול לעבוד בלי חיבור לאינטרנט?

טכנית כן, מדובר במודל שפה רגיל שמסוגל לפלוט טקסט. בפועל, כל האימון שלו נשען על קריאה לכלי חיפוש וביקור באתרים, ולכן בלי הכלים האלה הביצועים שלו יהיו דומים למודל בסיס קטן ולא שווים את המאמץ.

איך מחברים לו יכולת חיפוש בפועל?

המודל מפיק קריאות לפונקציות מסוג web_search ו־web_visit. צריך להרים שרת מתווך, למשל באמצעות פרוטוקול MCP, שתופס את הקריאות האלה, שולף את המידע ממנוע חיפוש ומחזיר את תוכן הדף למודל להמשך ניתוח.

איך מריצים

המשקל הכולל של הקבצים עומד על 8.2 גיגה בייט בפורמט bfloat16, כך שכרטיס מסך בודד עם 12 עד 16 גיגה זיכרון יריץ אותו בקלות. בתיעוד הם מציעים פקודת vLLM מוגזמת עם שמונה כרטיסים וחלון מורחב, אבל למשתמשי מק יש גרסת MLX ייעודית שרצה מקומית על המעבד הגרפי המובנה דרך Ollama או LM Studio.

ההרצה שלו לבד שווה את המאמץ רק אם אתם באמת מחברים לו כלי חיפוש וגלישה כמו שרת MCP מתאים. בלי חיבור אמיתי לרשת החיצונית אין שום היגיון לתחזק אותו לבד, ועדיף להישאר עם API רגיל.

from transformers import pipeline

pipe = pipeline("text-generation", model="Intelligent-Internet/II-Search-4B")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, לשלב אותו במוצרים סגורים ולהפיץ אותם בלי תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית והרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗