GPT
S

SpatialLM-Llama-1B

קוד פתוח

manycore-researchllama3.22025-03-14

  • transformers
  • safetensors
  • spatiallm_llama
  • text-generation
  • conversational

מודל שפה קטן שלוקח ענני נקודות תלת-ממדיים ומחלץ מהם קירות, דלתות ותיבות חוסמות לרהיטים. הוא מיועד למי שצריך לפענח מבנה של חדר מווידאו או מלידאר בלי להרים תשתית כבדה.

  • 1.2Bפרמטרים
  • 131,072טוקנים בהקשר
  • 2.4 GBמשקל הקבצים
  • 326הורדות בחודש

מה זה

במקום לעבוד עם טקסט רגיל, המודל מקבל ענן נקודות תלת-ממדי ומחזיר פלט מובנה של פריסת החלל והעצמים שבו. הוא מבוסס על Llama 3.2 1B יחד עם אנקודר גיאומטרי של SceneScript, ומסוגל להתמודד עם נתונים שמגיעים מווידאו בודד, מצלמות עומק או חיישני לידאר. הייחוד כאן הוא היכולת להוציא אלמנטים אדריכליים ותיבות תלת-ממדיות ישירות מתוך גיאומטריה לא מסודרת, במקום להסתמך רק על תמונות נקיות.

במבחנים על סט נתונים רועש מווידאו רגיל, הוא מציג דיוק מרשים בזיהוי קירות עם מדד חפיפה של 78.62, ובזיהוי מיטות הוא מגיע לציון F1 של 95.24. מנגד, בעצמים מורכבים או קטנים יותר הביצועים צונחים, למשל ארונות שמקבלים ציון של 8.47 בלבד ושולחנות צד עם 7.6. זה אומר שהוא מזהה מצוין את המסגרת הראשית של החדר ואת הרהיטים הענקיים, אבל מפספס בקלות את הפרטים הדקים.

מתאים ל

  • שרטוט קירות מווידאו

    חילוץ קווי מתאר של חדרים מתוך ענן נקודות שנבנה מווידאו רגיל, עם דיוק זיהוי קירות של מעל 78 אחוז.

  • רובוטיקה ומיפוי פנים

    זיהוי מיקום של מכשולים מרכזיים כמו מיטות וספות על גבי חומרה מקומית קלת משקל.

  • הערכת תכולת חדר ראשונית

    מיקום תיבות חוסמות גסות עבור רהיטים גדולים לפני שמעבירים את המודל לתהליכי עיבוד כבדים יותר.

איפה זה נופל

הקלט חייב להיות מיושר צירים מראש, כאשר ציר Z פונה כלפי מעלה, אחרת הפלט מתפרק לחלוטין. הוא מתקשה מאוד עם עצמים דקים או קטנים, כאשר כיסאות מקבלים ציון F1 של 21.26 בלבד ושטיחים 31.76. אסור לבנות עליו לספירת מלאי עדינה או לזיהוי מדויק של ריהוט קטן בחדר.

שאלות
נפוצות

אפשר להעלות אליו תמונות צבע רגילות ישר מהטלפון?

לא. המודל דורש ענן נקודות תלת-ממדי בקובץ PLY. בשביל וידאו או תמונות רגילות צריך להריץ קודם כלי שחזור גיאומטרי חיצוני כמו MASt3R-SLAM, ליישר את הצירים, ורק אז להזין את התוצאה למודל.

האם הוא מזהה את כל הרהיטים בחדר באותה רמת דיוק?

ממש לא. הוא מדויק מאוד על מיטות עם תוצאה של מעל 95 אחוז, וסביר על ספות, אבל נופל משמעותית בכיסאות, ארונות ושולחנות קטנים, שם הדיוק יורד מתחת ל־25 אחוז.

איך מריצים

כדי להריץ אותו צריך סביבת לינוקס עם פייתון 3.11, PyTorch 2.4.1 וקודה 12.4. ההתקנה דורשת קומפילציה מקומית של חבילת torchsparse, תהליך שלוקח זמן ותלוי בספריות מערכת ספציפיות כמו sparsehash. המודל שוקל 2.4 גיגה-בייט בפורמט bfloat16, כך שכרטיס מסך ביתי בסיסי עם 8 או 12 גיגה זיכרון יריץ אותו בקלות.

יש למפתחים גם גרסה קטנה יותר המבוססת על Qwen בנפח חצי מיליארד פרמטרים. אין כרגע שירות ענן שמציע את המודל הזה כ־API מוכן, ולכן אין ברירה אלא להרים אותו בעצמכם על גבי תשתית עצמאית.

from transformers import pipeline

pipe = pipeline("text-generation", model="manycore-research/SpatialLM-Llama-1B")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 2.4 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל עצמו יושב תחת רישיון Llama 3.2 של מטא, אבל הוא משלב בתוכו אנקודר מובנה של SceneScript שמופץ תחת רישיון CC-BY-NC-4.0. המשמעות המעשית היא שאי אפשר להשתמש במודל הזה למוצר מסחרי, אלא רק למחקר ושימוש פנימי לא מסחרי.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗