GPT
I

II-Medical-8B-1706

קוד פתוח

Intelligent-Internetapache-2.02025-06-16

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • conversational

התאמה רפואית ממוקדת על בסיס Qwen3-8B שמציגה תוצאות חזקות במבחני היגיון קליני. פתרון קומפקטי למי שצריך ניתוח רפואי מעמיק מקומית בלי לגרור משקלים של עשרות מיליארדי פרמטרים.

  • 8.2Bפרמטרים
  • 40,960טוקנים בהקשר
  • 15.3 GBמשקל הקבצים
  • 533הורדות בחודש

מה זה

הפיתוח הזה לוקח את משקלי הבסיס של Qwen3-8B ומעביר אותם כוונון עדין על מעל שני מיליון דוגמאות חשיבה רפואית, כולל עקבות חשיבה של R1 ואימון בלמידת חיזוק בשני שלבים. המטרה כאן ברורה, לייצר מודל קטן יחסית שמסוגל לפרק שאלות קליניות מורכבות שלב אחר שלב.

במבחני הביצועים הוא עוקף את מודל הבסיס שלו בפער ניכר, ורושם ממוצע של 70.5 נקודות בעשרה מבחני שאלות ותשובות רפואיים. מעבר למספרים היבשים, במבחן HealthBench הוא מקבל 46.8%, תוצאה שמתחרה ישירות במודלים כבדים בהרבה כמו MedGemma-27B של גוגל ומתקרבת לגרסת ה־32B של Qwen3, כך שהוא מצליח לספק רמת דיוק של מודל ענק במעטפת של שמונה מיליארד פרמטרים.

מתאים ל

  • סינון ומיון מחקרים

    ניתוח מאמרים מורכבים ממאגרי מחקר רפואיים ופירוק שלב אחר שלב של השאלות והמסקנות שעולות מהם.

  • עוזר לימודי למבחנים רפואיים

    מענה ופתרון מנומק לשאלות מרובות ברירה קליניות במתכונת MedQA או MedMCQA לצורכי תרגול.

  • חילוץ תובנות מטקסט ביולוגי

    הבנת טקסטים מדעיים וקליניים ארוכים מקומית בתוך הארגון בלי לחשוף מידע רגיש לשרתים חיצוניים.

איפה זה נופל

היוצרים מבהירים בשורה תחתונה ברורה שהתוצר אינו מתאים לשימוש רפואי קליני. מעבר לכך, הדאטהסטים שעליהם אומן עלולים להכיל הטיות מובנות מתוך חומרי המקור, וידע רפואי משתנה ומתיישן באופן שמחייב עדכונים שוטפים. אין כאן מנגנון אימות עובדות מובנה בזמן אמת, כך שבשאלות שחורגות מנתוני האימון קיימת סכנת הזיות שעלולה להטעות.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לאבחון חולים באפליקציה?

לא. כרטיס המודל מציין במפורש שהוא אינו מיועד ואינו מתאים לשימוש רפואי בפועל. מדובר בכלי מחקרי שמתאים להסבר מושגים, סימולציות ובדיקות תיאורטיות בלבד.

איך לגרום לו להוציא את התשובות הכי מדויקות?

המפתחים ממליצים לדרוש בפרומפט חשיבה שלב אחר שלב ולהגדיר את התשובה הסופית בתוך תבנית סגורה. בנוסף, כדאי לכוון את הטמפרטורה ל־0.6 ואת ה־top_p ל־0.9 כפי שהוגדר במדריך השימוש.

איך מריצים

המשקלים המקוריים שוקלים 15.3 גיגהבייט בפורמט bfloat16, כך שצריך כרטיס גרפי עם מספיק זיכרון וידאו כדי לטעון אותם במלואם, בערך 16 עד 24 גיגהבייט פנויים, במיוחד אם רוצים לנצל את חלון ההקשר המלא של 40,960 טוקנים. אם הזיכרון אצלכם מוגבל, המפתחים פרסמו גם גרסאות מכומתות בפורמט GGUF שמקצצות את דרישות החומרה ומאפשרות הרצה על מעבדים או כרטיסים צנועים יותר.

אפשר להרים אותו ישירות דרך מנועים כמו vLLM או SGLang. בהרצה מעשית המפתחים ממליצים להגדיר temperature של 0.6 ו־top_p של 0.9, ולבקש ממנו מפורשות בהוראות לנמק שלב אחרי שלב כדי לקבל את מלוא פוטנציאל ההיגיון שלו.

from transformers import pipeline

pipe = pipeline("text-generation", model="Intelligent-Internet/II-Medical-8B-1706")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי, שינוי קוד והפצה של המודל בתוך מוצרים פנימיים או חיצוניים. התנאים העיקריים הם שמירה על הודעת זכויות היוצרים המקורית והצהרה על שינויים שבוצעו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗