Dokhmal Vision · FixB
Dokhmal Vision-Language Layer (VLM) برای آنالیز چندزاویهای پوست
Dokhmal Vision لایه بینایی-زبانی و چندوجهی دخمل برای تحلیل غیرپزشکی پوست است. این لایه سه نمای کنترلشده از یک چهره را همراه با دستور و زمینه متنی در یک جریان استنتاج چندوجهی ترکیب میکند تا اطلاعات تصویری به خروجی ساختاریافته و قابل استفاده برای موتور تصمیم دخمل تبدیل شوند.
چرا این بخش واقعاً یک VLM layer محسوب میشود؟
در جریان فعلی دخمل، مدل فقط متن یا فقط یک تصویر دریافت نمیکند. ورودی شامل متن راهنما + تصویر روبهرو + تصویر مایل چپ + تصویر مایل راست است و تحلیل بصری در همان درخواست چندوجهی انجام میشود. به همین دلیل، در سطح معماری محصول، این بخش بهدرستی بهعنوان Vision-Language Model layer (VLM layer) یا لایه بینایی-زبانی چندوجهی توصیف میشود.
این تعریف به لایه استنتاج چندوجهی اشاره دارد و بهتنهایی به معنی آن نیست که وزنهای یک foundation VLM عمومی از صفر داخل FixB آموزش داده شدهاند.
پایپلاین بینایی اختصاصی دخمل قبل از VLM
تصویر خام مستقیماً و بدون کنترل وارد تحلیل نمیشود. قبل از استنتاج چندوجهی، دخمل یک پایپلاین اختصاصی کنترل ورودی اجرا میکند:
- الزام ثبت سه نمای FRONT، LEFT OBLIQUE و RIGHT OBLIQUE؛
- تشخیص یک چهره و کنترل framing و اندازه صورت؛
- اعتبارسنجی yaw و tilt برای هر مرحله؛
- استفاده از facial landmarks برای کنترل جهت و همترازی؛
- image-quality gate پیش از پذیرش تصویر؛
- stable auto-capture پس از پایدار ماندن وضعیت معتبر؛
- ایجاد context چندنما برای برآورد عمق نسبی و شبیهسازی سهبعدی محاسباتی.
سه تصویر چگونه وارد تحلیل چندوجهی میشوند؟
نمای روبهرو بهعنوان مرجع اصلی برای face box، landmarkها و markerهای هندسی استفاده میشود. دو نمای مایل بهعنوان supplemental visual evidence برای مشاهده بهتر گونهها، خط فک، بافت جانبی و تقارن به ورودی چندوجهی اضافه میشوند.
در لایه استنتاج، متن راهنما و تصاویر در یک پیام چندبخشی کنار هم قرار میگیرند. تصاویر با کیفیت تحلیلی بالا ارسال میشوند تا موتور چندوجهی بتواند میان دستور متنی و شواهد تصویری ارتباط برقرار کند.
مرزبندی Dokhmal Vision با موتور تصمیم
Dokhmal Vision مسئول تبدیل ورودی تصویری چندزاویهای به context و یافتههای بصری ساختاریافته است. سپس Dokhmal SLM و موتور تصمیم FixB این context را با پاسخهای کاربر، Safety Rules، Evidence Registry، روتین فعلی، بودجه و داده محصول ترکیب میکنند.
معماری بهصورت خلاصه:
Controlled Capture → Vision Pipeline → Vision-Language Analysis → Structured Skin Context → Safety & Decision Engine → Routine → Product Matching
چه بخشهایی در FixB ساخته شدهاند؟
بخشهای اختصاصی این زنجیره شامل جریان سهزاویهای، کنترل کیفیت، اعتبارسنجی زاویه، landmark logic، نگهداری کوتاهمدت امن نماهای جانبی، اتصال سه نما به درخواست چندوجهی، دستوردهی به تحلیل، post-processing، موتور تصمیم، safety و اتصال به روتین و محصول هستند.
این مجموعه بهعنوان Dokhmal Vision stack بخشی از فناوری اختصاصی FixB است و مستقل از یک رابط کاربری ساده یا یک «آپلود عکس و دریافت متن» طراحی شده است.
حریم خصوصی نماهای چندزاویهای
در جریان چندنما، تصاویر جانبی برای تحلیل بهصورت کوتاهمدت نگهداری میشوند و بهعنوان شواهد بصری مکمل استفاده میشوند. طراحی فعلی برای این داده موقت از ذخیرهسازی محدود و محافظتشده استفاده میکند و نمای روبهرو مرجع اصلی جریان تحلیل باقی میماند.
این فناوری پزشکی نیست
Dokhmal Vision برای تحلیل غیرپزشکی و مراقبت زیبایی طراحی شده است. خروجی آن تشخیص بیماری، اسکن پزشکی، LiDAR یا اندازهگیری بالینی عمق نیست. «اسکن سهبعدی» در این معماری به برآورد عمق و context فضایی محاسباتی از تصاویر چندزاویهای اشاره دارد.
صفحات فنی مرتبط
English summary
Dokhmal Vision is FixB’s multimodal vision-language analysis layer for non-medical skincare. It combines controlled front, left-oblique and right-oblique facial views with textual instructions in a multimodal inference request. The in-house FixB vision stack performs capture control, image-quality gating, angle validation, facial-landmark processing, multi-view orchestration and downstream decision integration before and after the VLM inference layer.