استخدام nlp clustering) machine learning engineer آقا دورکاری)

5 ساعت پیش | کد آگهی: 11991103

دسته‌بندی شغلی

-

جنسیت و تاهل

آقا | مجرد و متاهل

موقعیت مکانی

تهران

تحصیلات

-

محل فعالیت

شرکت دانش بنیان

مزایا

بیمه

مهارت ها و زبان ها

برنامه نویسی Python - کار با Linux

نوع همکاری

دورکاری - تمام وقت - امریه

سایر اطلاعات

توضیحات آگهی

پرتو یک پلتفرم تحلیل داده است که فهمیدن شبکه های اجتماعی و فضای آنلاین را برای سازمان ها نهادها و کسب وکارهای بزرگ ساده تر می کند ما داده ی شبکه های اجتماعی و رسانه ها را کرال می کنیم پردازش می کنیم و در قالب تحلیل قابل فهم ارائه می دهیم تیم در حال رشد است و دنبال یک Machine Learning Engineer با تمرکز روی NLP و Clustering هستیم
یکی از چالش های اصلی ما این است که از بین حجم بزرگی از محتوای شبکه های اجتماعی موضوع ها رویدادها و جریان های مشابه را به صورت خودکار پیدا کنیم برای این کار با حجم بالایی از embeddingهای متنی الگوریتم های خوشه بندی و مدل های زبانی سر و کار داریم و نیاز داریم این فرایند علاوه بر دقت در مقیاس بالا هم قابل اجرا باشد
استک و ابزارها
Python NumPy Scikit learn
HDBSCAN K Means Faiss
PCA UMAP
Milvus Elasticsearch
Embedding Models LLMs
کاری که انجام می دهی
طراحی و توسعه ی سیستم خوشه بندی محتوای شبکه های اجتماعی از انتخاب و ارزیابی الگوریتم مناسب تا اجرای آن روی چندصد هزار یا چند میلیون embedding متنی
کار با الگوریتم هایی مثل HDBSCAN و K Means و ابزارهایی مثل Faiss تنظیم پارامترها و تحلیل کیفیت خوشه هایی که تولید می شوند
طراحی راهکار برای داده های واقعی جایی که بعضی داده ها نویز هستند اندازه ی خوشه ها متفاوت است و چگالی داده ها همیشه یکسان نیست
استفاده از روش هایی مثل PCA و UMAP برای کاهش ابعاد و بهینه تر کردن فرایند تحلیل و Clustering
طراحی pipeline مقیاس پذیر برای پردازش داده های جدید به شکلی که مدل فقط یک آزمایش روی Notebook نباشد و بتواند به صورت پایدار در Production اجرا شود
استخراج نمونه ی نماینده عنوان یا توضیح معنایی برای هر خوشه و در صورت نیاز استفاده از مدل های زبانی برای نام گذاری یا خلاصه سازی Clusterها
خواندن embeddingها از Milvus ذخیره و versioning نتایج در Elasticsearch و بهینه سازی مصرف RAM و CPU در پردازش حجم بالای داده
تعریف و بررسی معیارهای ارزیابی مثل Silhouette Score پایداری Clusterها و ارزیابی انسانی نمونه های خروجی
چی برای ما مهم است
تسلط خوب به Python NumPy و Scikit learn
تجربه ی عملی با الگوریتم های Clustering مثل HDBSCAN K Means یا روش های مشابه
درک خوب از embeddingهای متنی فضای برداری و معیارهایی مثل Cosine Similarity
آشنایی با Faiss یا ابزارهای مشابه برای جست وجو و پردازش حجم بالای بردارها
تجربه ی کار با PCA UMAP یا روش های مشابه کاهش ابعاد
توانایی تحلیل رفتار الگوریتم های Unsupervised و تنظیم پارامترها بر اساس ویژگی داده
آشنایی با پردازش Batch و بهینه سازی مصرف حافظه و منابع پردازشی
توانایی تبدیل یک مدل یا آزمایش تحقیقاتی به pipeline قابل اجرا و قابل نگهداری در Production
خوب است اگر داشته باشی
تجربه ی کار با مدل های زبانی و embeddingهای فارسی
آشنایی یا تجربه ی عملی با Milvus یا سایر Vector Databaseها
تجربه ی کار با Elasticsearch
تجربه ی Clustering روی چندصد هزار تا چند میلیون بردار
آشنایی با Docker و Linux
تجربه ی استفاده از LLMها برای نام گذاری خلاصه سازی یا توصیف خودکار Clusterها
مزایای همکاری با ما
انعطاف کامل دورکاری هیبرید یا حضوری در دفتر تهران ساعت ورود و خروج نداریم
ابزار AI برای همه ی اعضای تیم فراهم می شود
چالش های فنی گسترده چند میلیارد رکورد داده سیستم هایی که در مقیاس بزرگ کار می کنند استک متنوع
بیمه ی تکمیلی سفر سالانه ی گروهی وام دوره ای و امکان امریه ی دانش بنیان برای آقایان واجد شرایط
شرکت پرتو Parto
دسته بندی وب برنامه نویسی و نرم افزار
نحوه همکاری تمام وقت دورکاری
نوع همکاری دورکاری
مدرک تحصیلی مهم نیست
سابقه کار کمتر از سه سال
حقوق توافقی
جنسیت مرد
مهارت ها یادگیری ماشین Python numpy
شهر تهران تهران

هشدار

جویا کار این آگهی را از سایت جابینجا استخراج نموده است و هیچ مسئولیتی در قبال این آگهی ندارد.
دقت نمایید که کارفرما حق دریافت هیچ گونه وجهی از کارجو را نداشته و این امر خلاف قانون است. در صورت مشاهده این موارد یا سایر تخلفات با کلیک روی (گزارش آگهی) ما را در ارائه خدمات بهتر یاری نمایید.
در غیر این صورت میتوانید با کلیک بر روی دکمه "درج نظر" نظر خود را در مورد این آگهی ثبت کنید.

نظرات در مورد این آگهی: درج نظر

هیچ نظری برای این آگهی ثبت نشده است.