دسته بندی محصولات
شـــــگفت

Dokhmal Vision · FixB

Dokhmal Vision-Language Layer (VLM) برای آنالیز چندزاویه‌ای پوست

Dokhmal Vision لایه بینایی-زبانی و چندوجهی دخمل برای تحلیل غیرپزشکی پوست است. این لایه سه نمای کنترل‌شده از یک چهره را همراه با دستور و زمینه متنی در یک جریان استنتاج چندوجهی ترکیب می‌کند تا اطلاعات تصویری به خروجی ساختاریافته و قابل استفاده برای موتور تصمیم دخمل تبدیل شوند.

چرا این بخش واقعاً یک VLM layer محسوب می‌شود؟

در جریان فعلی دخمل، مدل فقط متن یا فقط یک تصویر دریافت نمی‌کند. ورودی شامل متن راهنما + تصویر روبه‌رو + تصویر مایل چپ + تصویر مایل راست است و تحلیل بصری در همان درخواست چندوجهی انجام می‌شود. به همین دلیل، در سطح معماری محصول، این بخش به‌درستی به‌عنوان Vision-Language Model layer (VLM layer) یا لایه بینایی-زبانی چندوجهی توصیف می‌شود.

این تعریف به لایه استنتاج چندوجهی اشاره دارد و به‌تنهایی به معنی آن نیست که وزن‌های یک foundation VLM عمومی از صفر داخل FixB آموزش داده شده‌اند.

پایپ‌لاین بینایی اختصاصی دخمل قبل از VLM

تصویر خام مستقیماً و بدون کنترل وارد تحلیل نمی‌شود. قبل از استنتاج چندوجهی، دخمل یک پایپ‌لاین اختصاصی کنترل ورودی اجرا می‌کند:

  • الزام ثبت سه نمای FRONT، LEFT OBLIQUE و RIGHT OBLIQUE؛
  • تشخیص یک چهره و کنترل framing و اندازه صورت؛
  • اعتبارسنجی yaw و tilt برای هر مرحله؛
  • استفاده از facial landmarks برای کنترل جهت و هم‌ترازی؛
  • image-quality gate پیش از پذیرش تصویر؛
  • stable auto-capture پس از پایدار ماندن وضعیت معتبر؛
  • ایجاد context چندنما برای برآورد عمق نسبی و شبیه‌سازی سه‌بعدی محاسباتی.

سه تصویر چگونه وارد تحلیل چندوجهی می‌شوند؟

نمای روبه‌رو به‌عنوان مرجع اصلی برای face box، landmarkها و markerهای هندسی استفاده می‌شود. دو نمای مایل به‌عنوان supplemental visual evidence برای مشاهده بهتر گونه‌ها، خط فک، بافت جانبی و تقارن به ورودی چندوجهی اضافه می‌شوند.

در لایه استنتاج، متن راهنما و تصاویر در یک پیام چندبخشی کنار هم قرار می‌گیرند. تصاویر با کیفیت تحلیلی بالا ارسال می‌شوند تا موتور چندوجهی بتواند میان دستور متنی و شواهد تصویری ارتباط برقرار کند.

مرزبندی Dokhmal Vision با موتور تصمیم

Dokhmal Vision مسئول تبدیل ورودی تصویری چندزاویه‌ای به context و یافته‌های بصری ساختاریافته است. سپس Dokhmal SLM و موتور تصمیم FixB این context را با پاسخ‌های کاربر، Safety Rules، Evidence Registry، روتین فعلی، بودجه و داده محصول ترکیب می‌کنند.

معماری به‌صورت خلاصه:

Controlled Capture → Vision Pipeline → Vision-Language Analysis → Structured Skin Context → Safety & Decision Engine → Routine → Product Matching

چه بخش‌هایی در FixB ساخته شده‌اند؟

بخش‌های اختصاصی این زنجیره شامل جریان سه‌زاویه‌ای، کنترل کیفیت، اعتبارسنجی زاویه، landmark logic، نگهداری کوتاه‌مدت امن نماهای جانبی، اتصال سه نما به درخواست چندوجهی، دستوردهی به تحلیل، post-processing، موتور تصمیم، safety و اتصال به روتین و محصول هستند.

این مجموعه به‌عنوان Dokhmal Vision stack بخشی از فناوری اختصاصی FixB است و مستقل از یک رابط کاربری ساده یا یک «آپلود عکس و دریافت متن» طراحی شده است.

حریم خصوصی نماهای چندزاویه‌ای

در جریان چندنما، تصاویر جانبی برای تحلیل به‌صورت کوتاه‌مدت نگهداری می‌شوند و به‌عنوان شواهد بصری مکمل استفاده می‌شوند. طراحی فعلی برای این داده موقت از ذخیره‌سازی محدود و محافظت‌شده استفاده می‌کند و نمای روبه‌رو مرجع اصلی جریان تحلیل باقی می‌ماند.

این فناوری پزشکی نیست

Dokhmal Vision برای تحلیل غیرپزشکی و مراقبت زیبایی طراحی شده است. خروجی آن تشخیص بیماری، اسکن پزشکی، LiDAR یا اندازه‌گیری بالینی عمق نیست. «اسکن سه‌بعدی» در این معماری به برآورد عمق و context فضایی محاسباتی از تصاویر چندزاویه‌ای اشاره دارد.

صفحات فنی مرتبط

English summary

Dokhmal Vision is FixB’s multimodal vision-language analysis layer for non-medical skincare. It combines controlled front, left-oblique and right-oblique facial views with textual instructions in a multimodal inference request. The in-house FixB vision stack performs capture control, image-quality gating, angle validation, facial-landmark processing, multi-view orchestration and downstream decision integration before and after the VLM inference layer.