GPT
T

TwIL-LM3

קוד פתוח

webAI-Officialother2026-08-03

  • transformers
  • safetensors
  • gguf
  • smollm3
  • text-generation

מודל של 3.1 מיליארד פרמטרים שעבר התאמה ממוקדת ללוגיקה פורמלית. הוא מתאים למי שמחפש הסקת מסקנות קצרה ומדויקת בלי המשאבים של מודלי ענק.

  • 3.1Bפרמטרים
  • 65,536טוקנים בהקשר
  • 20.7 GBמשקל הקבצים
  • 364,509הורדות בחודש

מה זה

הבסיס הוא SmolLM3-3B, שעבר אימון ייעודי למשימות כמו תרגום ללוגיקה מסדר ראשון, הצרנה ב־Lean, ניתוח סמנטי ובדיקת גרירה לוגית. בניגוד לרוב המודלים בגודל הזה שמאבדים יכולות כלליות אחרי אימון ייעודי, תהליך האינטרפולציה שבוצע כאן שמר על הביצועים במבחנים חיצוניים ואף שיפר אותם מעט, למשל במבחן ה־10-dataset macro שעלה מ־0.7193 ל־0.7339.

במבחני לוגיקה ייעודיים הוא עוקף מודלים גדולים ממנו כמו LFM2.5-8B-A1B בכל ששת תחומי המדידה הישירים. הוא לא מגיע לתוצאות של Qwen3-8B או מודלים של מאה מיליארד פרמטרים, אבל מפיק תשובות קצרות משמעותית, עם ממוצע של 482 טוקנים, מה שמאפשר לו לייצר 28.1 עד 32.9 תשובות בשנייה.

מתאים ל

  • הצרנה לשפת Lean

    מגיע לתוצאת token-F1 של 0.5869 ועוקף בקלות מודלים גדולים ממנו כמו Qwen3-8B.

  • בדיקת תקפות של היסקים

    מיועד להכרעה קצרה ומדויקת בין גרירה, סתירה או ניטרליות על חומרה בסיסית.

  • ניתוח סמנטי ותרגום לוגי

    מייצר פלט מבני תמציתי של עובדות וכללים בקצב גבוה של מעל 28 תשובות בשנייה.

איפה זה נופל

זה אינו כלי לשיחה כללית, לתכנות או לשימוש בכלים חיצוניים. לא נעשה לו כיוונון בטיחות או התאמה להעדפות אנושיות, ובמבחן IFEval למעקב אחרי הוראות חלה נסיגה לעומת מודל הבסיס. בעיה נוספת היא חיתוך טוקנים: 4.4% מהתשובות במבחני הלוגיקה הגיעו לתקרת ה־2048 טוקנים ונפסלו לחלוטין. כמו כן, חלון ההקשר של 65,536 טוקנים נלקח ישירות ממודל הבסיס ולא נבדק מעבר ל־8,192 טוקנים.

שאלות
נפוצות

האם אפשר להשתמש בו בתור צ'אטבוט או עוזר אישי באפליקציה?

לא. המודל אומן באופן בלעדי על לוגיקה פורמלית מול בודקים אוטומטיים. אין בו סינון בטיחותי, ביצועיו במעקב אחרי הוראות מורכבות נמוכים יחסית, והוא פולט תמיד בלוק חשיבה לפני התשובה.

למה המודל מחזיר תשובות שגויות או חלקיות בריצה מקומית?

קובץ ההגדרות מגיע בטעות עם פרמטרי דגימה של מודל הבסיס. חובה להעביר do_sample=False בקוד ולהקצות לפחות 2048 טוקנים לפלט, אחרת תהליך ההסקה נקטע באמצע והתשובה נהרסת.

איך מריצים

משקל ה־bfloat16 המלא שוקל 5.73 גיגה-בייט ורץ בקלות על כרטיס מסך בודד או דרך vLLM. בנוסף קיימות בתיקייה גרסאות GGUF מוכנות ל־llama.cpp, כשהגרסה המומלצת Q4_K_M שוקלת 1.78 גיגה-בייט ודורשת רק מעבד סביר או 4 גיגה-בייט של זיכרון גרפי.

חובה להגדיר פענוח חמדן ללא דגימה ותקציב יצירה של לפחות 2048 טוקנים. ברירות המחדל בקובץ התצורה כוללות דגימה אקראית, ואם משאירים אותן או מקצים מעט מדי טוקנים, בלוק החשיבה נחתך והדיוק צונח. אין סיבה לקרוא ל־API חיצוני עבור סדר גודל כזה של זיכרון.

ollama run hf.co/webAI-Official/TwIL-LM3:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא webAI Non-Commercial License גרסה 1.0, למרות שמודל הבסיס שוחרר ברישיון Apache 2.0. המשמעות היא שאסור לחלוטין להשתמש במודל הזה במוצר מסחרי, אלא רק למחקר, בדיקות או פרויקטים פנימיים שאינם למטרות רווח.

הרישיון המלא בעמוד המודל ↗