مفت ذرائع
AIEZZ ٹول ٹیگ
“مفت ذرائع” ٹیگ والی اے آئی مصنوعات دیکھی جا رہی ہیں؛ 29 مماثل نتائج ہیں۔
SmartSub – اوپن سورس آل اِن ون آڈیو ویڈیو سب ٹائٹل پروسیسنگ ڈیسک ٹاپ ٹولAI اسپیچ ریکگنیشنSmartSub (妙幕) ایک اوپن سورس آل اِن ون آڈیو ویڈیو سب ٹائٹل پروسیسنگ ڈیسک ٹاپ ٹول ہے۔ یہ ٹول مکمل ورک فلو کو ایک ہی ایپلی کیشن میں یکجا کرتا ہے، اور Whisper، FunASR، Qwen3-ASR جیسے مقامی ماڈلز کی مدد سے آف لائن صوتی متن نگاری کرتا ہے۔ یہ 20 سے زائد ترجمہ سروسز اور متعدد کرداروں والی AI وائس اوور کو سپورٹ کرتا ہے۔ اس میں آن لائن ویڈیو ڈاؤن لوڈر شامل ہے جو B站، YouTube جیسے پلیٹ فارمز سے مطابقت رکھتا ہے۔ NVIDIA CUDA، Apple Core ML جیسی ہارڈویئر ایکسلریشن کے ساتھ یہ Windows، macOS، Linux تینوں پلیٹ فارمز پر مقامی طور پر چلتا ہے۔00
InstructAV2AV – 智源 اور بیجنگ یونیورسٹی کا مشترکہ اوپن سورس آڈیو ویڈیو مشترکہ ایڈیٹنگ ماڈلتصویری تدوینInstructAV2AV – 智源 اور بیجنگ یونیورسٹی کا مشترکہ اوپن سورس آڈیو ویڈیو مشترکہ ایڈیٹنگ ماڈل، بیجنگ اکیڈمی آف آرٹیفیشل انٹیلیجنس اور بیجنگ یونیورسٹی کی جانب سے مشترکہ طور پر پیش کیا گیا آڈیو ویڈیو مشترکہ ایڈیٹنگ ماڈل ہے۔ صارف صرف ایک قدرتی زبان کی ہدایت کے ذریعے اینڈ ٹو اینڈ جنریشن کے دوران ویڈیو کے مناظر اور متعلقہ آواز کو بیک وقت ایڈٹ کر سکتا ہے، اس کے لیے دستی ماسک یا مرحلہ وار پروسیسنگ کی ضرورت نہیں ہوتی۔ ماڈل مکالموں میں ترمیم، کرداروں کی تبدیلی، اشیا کا اضافہ اور حذف کرنے کی سہولت فراہم کرتا ہے، جبکہ پس منظر اور ماحول کی آوازوں کو برقرار رکھتے ہوئے آواز اور تصویر کی زمانی ہم آہنگی قائم رکھتا ہے۔ بنیادی خصوصیات میں شناخت برقرار رکھتے ہوئے آواز میں ترمیم، آڈیو ویڈیو مثالوں کی تبدیلی، مثالوں کا اضافہ، مثالوں کا حذف اور صفات کی مشترکہ ایڈیٹنگ شامل ہیں۔ یہ فلمی پوسٹ پروڈکشن، مختصر ویڈیو سازی، ورچوئل انسانوں کے انتظام، اشتہاری تخلیق اور تعاملی مواد کی تیاری جیسے شعبوں کے لیے موزوں ہے۔00
JoyAI-Video-EditAI ویڈیو ایڈیٹنگJoyAI-Video-Edit – جے ڈی ڈاٹ کام کا اوپن سورس ریئل ٹائم اسٹریمنگ ویڈیو ایڈیٹنگ ماڈل، جے ڈی ڈاٹ کام کی جانب سے اندرونی طور پر تیار کردہ اوپن سورس ریئل ٹائم اسٹریمنگ ویڈیو ایڈیٹنگ ماڈل ہے۔ یہ 16B پیرامیٹرز پر مبنی آٹو ریگریسو ڈفیوژن آرکیٹیکچر استعمال کرتا ہے، 720P ریزولوشن پر 30FPS کی推理 رفتار حاصل کرتا ہے اور کسی بھی دورانیے کی مستحکم اسٹریمنگ ایڈیٹنگ کو سپورٹ کرتا ہے۔ صارفین ویڈیو کی مکمل تخلیق کا انتظار کیے بغیر، ویڈیو چلنے کے دوران قدرتی زبان کی ہدایات کے ذریعے کرداروں، مناظر، انداز اور اشیا میں ریئل ٹائم تبدیلیاں کر سکتے ہیں۔ OpenVE-Bench کی جانچ میں اس ماڈل نے تمام اسٹریمنگ ایڈیٹنگ طریقوں کو پیچھے چھوڑتے ہوئے تمام اشاریوں میں نمایاں برتری حاصل کی، اور مجسم ذہانت کے لیے بڑے پیمانے پر ڈیٹا سنتھیسس کا راستہ بھی فراہم کر سکتا ہے۔00
Orchard – مائیکروسافٹ ریسرچ کا اوپن سورس Agentic AI ماڈلنگ فریم ورکAI انٹیلی جنٹ ایجنٹOrchard – مائیکروسافٹ ریسرچ کا اوپن سورس Agentic AI ماڈلنگ فریم ورک۔ یہ فریم ورک Kubernetes پر مبنی Orchard Env ماحول سروس کو مرکزی حیثیت دیتا ہے اور ڈیٹا ڈسٹلیشن، reinforcement learning rollout اور جائزے کے لیے مختلف شعبوں میں سینڈ باکسز کے دوبارہ استعمال کی حمایت کرتا ہے، جبکہ سافٹ ویئر انجینئرنگ، براؤزر نیویگیشن اور ذاتی معاونت کے تین بڑے منظرناموں کا احاطہ کرتا ہے۔ یہ مکمل SFT + RL تربیتی فارمولے، 107K SWE ٹریجز اور 3,070 GUI ملٹی موڈل rollout ڈیٹا فراہم کرتا ہے، اور Codex، OpenClaw جیسے حقیقی harness میں براہِ راست end-to-end تربیت ممکن بناتا ہے۔ Agent تحقیق و ترقی کی علمی اور صنعتی ٹیموں کے لیے Orchard کم کمپیوٹنگ اور میزبانی کی لاگت فراہم کرتا ہے، جبکہ مختلف harness میں عمومی کارکردگی کے ذریعے چھوٹے ماڈلز کو جدید ترین کارکردگی کے قریب پہنچانے میں مدد دیتا ہے۔00
Alpamayo 2 Super – NVIDIA کا اوپن سورس خودکار ڈرائیونگ AI استدلالی ماڈلAI پروگرامنگAlpamayo 2 Super، NVIDIA کا اوپن سورس خودکار ڈرائیونگ AI استدلالی ماڈل ہے، جو NVIDIA Cosmos 3 Super Reasoner پر مبنی ہے اور 360° ماحول کا ادراک، جدید ڈرائیونگ فیصلے اور خودکار استدلالی لیبل تیار کرنے کی صلاحیت رکھتا ہے۔ یہ ماڈل LingoQA خودکار ڈرائیونگ استدلالی بینچ مارک میں پہلے نمبر پر ہے اور OpenMDW-1.1 لچک دار لائسنس کے تحت جاری کیا گیا ہے، جو فائن ٹیوننگ، مشتقات اور تجارتی دوبارہ تقسیم کی اجازت دیتا ہے۔ اس کے ساتھ Alpamayo 1.5 / 1 ورژن بھی فراہم کیے گئے ہیں، جو کلاؤڈ ڈیولپمنٹ اور گاڑی میں ڈسٹلیشن تعیناتی کے لیے ہیں، اور Robotaxi و خودکار ڈرائیونگ گاڑیوں کے شعبوں کو ہدف بناتے ہیں۔00
wigoloAI انٹیلی جنٹ ایجنٹwigolo ایک اوپن سورس مقامی سرچ ٹول ہے، جو MCP کے ذریعے Claude Code، Cursor جیسے پروگرامنگ ایجنٹس سے منسلک ہوتا ہے۔ API Key کی ضرورت نہیں، کوئی لاگت نہیں، اور مقامی طور پر سرچ، ویب صفحات حاصل کرنا، پوری ویب سائٹ کو کرال کرنا، ساختی استخراج، کیشنگ اور تحقیق مکمل کی جا سکتی ہے۔00
MemHarness – شنگھائی AI Lab وغیرہ کا پیش کردہ ایجنٹ میموری کی بازتشکیل کا فریم ورکAI انٹیلی جنٹ ایجنٹMemHarness، شنگھائی AI Lab نے ژے جیانگ یونیورسٹی، فودان یونیورسٹی، شنگھائی جیاو تونگ یونیورسٹی اور دیگر جامعات کے ساتھ مل کر تیار کیا ہے۔ یہ LLM Agent کے لیے میموری کی بازتشکیل کا فریم ورک ہے۔ یہ بازیافت اور عمل کے درمیان تنقید اور بازتشکیل کے مراحل شامل کرتا ہے، اور موجودہ سیاق و سباق کی بنیاد پر تاریخی تجربات کو برقرار رکھتا، دوبارہ لکھتا یا ترک کرتا ہے۔ GRPO کے ذریعے آخر سے آخر تک تربیت دی جاتی ہے، جس کے لیے اضافی انسانی لیبلنگ درکار نہیں ہوتی۔ یہ فریم ورک میموری بازیافت، تنقیدی بازتشکیل، عمل کی تخلیق، تجربے کی واپسی اور چھانٹی سمیت مکمل ورک فلو فراہم کرتا ہے، اور پانچ مرحلوں پر مشتمل فیصلہ سازی کا عمل پیش کرتا ہے۔ اس کے 7B پیرامیٹر ماڈل نے ALFWorld اور WebShop پر بالترتیب Gemini-2.5-Pro سے 23.1% اور 39.7% بہتر کارکردگی دکھائی، جبکہ تقسیم سے باہر کے منظرناموں میں اوسط کامیابی کی شرح 85.9% رہی۔ یہ مجسم ذہانت پر مبنی گھریلو کام، خودکار آن لائن خریداری، ذہین کسٹمر سروس اور کوڈ معاون ترقی جیسے منظرناموں کے لیے موزوں ہے۔10
ForgeStencil – 面壁智能 کا Stencil کے لیے مکمل خودکار تحقیقی اور تعیناتی نظامAI انٹیلی جنٹ ایجنٹForgeStencil – 面壁智能 کا Stencil کے لیے مکمل خودکار تحقیقی اور تعیناتی نظام، 面壁智能 اور OpenBMB کمیونٹی نے مشترکہ طور پر تیار کیا ہے۔ یہ Kernel Agent اور App Agent پر مشتمل دو ایجنٹوں کے بند لوپ کے فن تعمیر کو اپناتا ہے۔ یہ اصلاحی حکمتِ عملیوں کی دریافت، اعلیٰ کارکردگی والے CUDA Kernel کی ترکیب، اور پروڈکشن معیار کی ایپلی کیشن میں انضمام و توثیق سمیت پورا عمل خودکار طور پر مکمل کرتا ہے، جس میں انسانی مداخلت کی ضرورت نہیں ہوتی۔ نظام نے ایک ہفتے میں 100 سے زیادہ صنعتی اور سائنسی کمپیوٹنگ سافٹ ویئرز کی اینڈ ٹو اینڈ اصلاح مکمل کی، جبکہ درمیانی رفتار میں 1.41 گنا اضافہ حاصل کیا۔ یہ تیل و گیس کی تلاش، برقی مقناطیسی تخروپن، طبی امیجنگ سمیت 8 بڑے صنعتی اور 5 بڑے سائنسی شعبوں کا احاطہ کرتا ہے، اور HPC ماہرین پر انحصار اور تحقیق و ترقی کے دورانیے کو نمایاں طور پر کم کرتا ہے۔00
dots.ttsAI آواز کی ترکیبdots.tts، ژیاؤہونگشو کی dots ٹیم اور شنگھائی جیاو تونگ یونیورسٹی کی X-LANCE لیبارٹری کے اشتراک سے اوپن سورس کیا گیا 2 ارب پیرامیٹرز پر مشتمل مکمل مسلسل خودکار صوتی ترکیب کا بنیادی ماڈل ہے۔ یہ ماڈل براہِ راست مسلسل مخفی فضایٔ میں 48kHz آڈیو کو حصوں میں تیار کرتا ہے، جبکہ...00
ShieldstralAI سوال و جوابShieldstral – Mistral AI کا اوپن سورس ملٹی موڈل مواد کی حفاظت کا درجہ بند ماڈل، Mistral AI کا تیار کردہ 3B پیرامیٹرز پر مشتمل اوپن سورس ملٹی موڈل مواد کی حفاظت کا درجہ بند ماڈل ہے، جو Ministral-3B پر مبنی ہے۔ یہ ماڈل روایتی مقررہ زمروں پر مبنی مواد کی جانچ کو بائنری سوال و جواب کے کام میں تبدیل کرتا ہے، قدرتی زبان کے سوالات کے ذریعے حقیقی وقت میں جانچ کی پالیسیاں متعین کرنے کی سہولت دیتا ہے، اور دوبارہ تربیت کے بغیر مختلف حالات کے مطابق ڈھل سکتا ہے۔ ماڈل نے متنی حفاظتی بینچ مارک پر اوسط F1 اسکور 84.9% اور ملٹی موڈل حفاظت پر F1 اسکور 83.8% حاصل کیا، دونوں SOTA ہیں۔ اسے صرف ایک 16GB GPU پر تعینات کیا جا سکتا ہے اور یہ 12 زبانوں کو سپورٹ کرتا ہے۔ بنیادی خصوصیات میں پالیسی کے مطابق ڈھلنے والی جانچ، ملٹی موڈل متحدہ شناخت، خلاف ورزیوں کی باریک سطح پر شناخت، کیلیبریٹڈ حفاظتی اسکورنگ اور ہلکی پھلکی اینڈ ڈیوائس تعیناتی شامل ہیں۔ یہ سوشل پلیٹ فارم کے مواد کے خطرے کے کنٹرول، AI گفتگو کے حفاظتی تحفظ، اشتہارات اور مارکیٹنگ کی تعمیل، آن لائن تعلیمی مواد کی فلٹرنگ اور کاروباری دستاویزات کے حفاظتی آڈٹ جیسے حالات کے لیے موزوں ہے۔00
PAST-BenchAI انٹیلی جنٹ ایجنٹPAST-Bench پرنسٹن یونیورسٹی کی وانگ مینگڈی کی ٹیم کی جانب سے پیش کیا گیا ایک بینچ مارک ہے، جو ذاتی AI Agent کی تکراری خود بہتری کی صلاحیت جانچنے کے لیے استعمال ہوتا ہے۔ PAST-Bench یادداشت کے ساتھ اور یادداشت کے بغیر حالات میں کام کی کارکردگی کا موازنہ کرکے یہ فیصلہ کرتا ہے کہ...00
PixelRAGڈویلپمنٹ پلیٹ فارمPixelRAG برکلے SkyLab/BAIR کا اوپن سورس بصری مقامی RAG فریم ورک ہے۔ یہ ویب صفحات کو سادہ متن میں تبدیل کرکے تلاش کرنے کے روایتی طریقے سے ہٹ کر براؤزر کے ذریعے ویب صفحات اور PDF کو اسکرین شاٹ ٹائلز میں رینڈر کرتا ہے، اور LoRA سے فائن ٹیون کیے گئے...00
LTX-2.5AI ویڈیو جنریشنLTX-2.5، LTX کا اوپن سورس AI ویڈیو جنریشن فاؤنڈیشن ماڈل ہے، جس میں 22B پیرامیٹرز ہیں اور ریلیز کے ساتھ ہی اس کے وزن دستیاب کر دیے گئے ہیں۔ ماڈل مقامی ملٹی شاٹ جنریشن، 4K HDR اور RAW/EXR پروفیشنل ورک فلو کو سپورٹ کرتا ہے، آڈیو بھی بیک وقت تیار کر سکتا ہے، اور...00
HOMIEAI ویڈیو جنریشنHOMIE ہانگ کانگ یونیورسٹی آف سائنس اینڈ ٹیکنالوجی کا اوپن سورس ڈیجیٹل ہیومن ویڈیو جنریشن فریم ورک ہے، جو Wan2.1-T2V-14B بیک بون نیٹ ورک پر مبنی ہے اور Qwen3-VL ملٹی موڈل بڑے ماڈل کو مربوط کرتا ہے۔ یہ فریم ورک ڈیجیٹل انسان، مصنوعات، Logo اور متن کے چار عناصر کو یکجا طور پر ہینڈل کرتا ہے، ...00
Palmier ProAI ویڈیو ایڈیٹنگPalmier Pro AI کے دور کے لیے بنایا گیا macOS کا مقامی ویڈیو ایڈیٹر ہے، جسے Swift میں ابتدا سے تیار کیا گیا ہے۔ یہ اوپن سورس ہے اور اس کی بنیادی خصوصیات مفت ہیں۔ یہ پروڈکٹ جنریٹو AI کو براہِ راست ٹائم لائن میں شامل کرتا ہے اور Seedance، Kling ... کو سپورٹ کرتا ہے۔00
MindMemOS – ہواوے نوحہ آرک لیب کا اوپن سورس AI Agent میموری آپریٹنگ سسٹمAI انٹیلی جنٹ ایجنٹMindMemOS – ہواوے نوحہ آرک لیب کا اوپن سورس AI Agent میموری آپریٹنگ سسٹم، جس کا مقصد طویل مدتی میموری مینجمنٹ کی ضرورت رکھنے والے ایجنٹس کے لیے ایک اوپن سورس، دوبارہ قابلِ استعمال میموری لیئر فراہم کرنا ہے۔ یہ entity-attribute-time کے سہ جہتی ڈھانچے کو اپناتا ہے، میموری کو کسی ایک Agent سے الگ کر کے مختلف فریم ورکس میں استعمال ہونے والا آزاد اثاثہ بناتا ہے، اور Dreaming آف لائن تنظیم، Feedback کے ذریعے اصلاح، اور Skill Evolution کی خودکار ترقی جیسے طریقۂ کار سے میموری کو مسلسل بہتر کرتا ہے۔ یہ نظام دوہری طرز کی میموری تحریر (MindVanilla، MindSchema) اور متعدد راستوں پر مبنی Compact Search فراہم کرتا ہے، جبکہ Docker مقامی تعیناتی، کلاؤڈ API، Python SDK، CLI اور دیگر طریقۂ ہائے انضمام کو سپورٹ کرتا ہے۔ 94% سے زیادہ ساختی بازیابی کی درستگی اور کمپریس کی گئی میموری کے بعد سوال و جواب کی درستگی میں 10% اضافے کے ساتھ، یہ ڈویلپرز کو ذاتی معاونین، متعدد Agent کے تعاون اور پیچیدہ دفتری خودکاری جیسے منظرناموں میں سیشنز کے درمیان معلومات کے اشتراک اور کام کی کارکردگی بہتر بنانے میں مدد دیتا ہے۔00
Nemotron 3.5 LightningAI انٹیلی جنٹ ایجنٹNemotron 3.5 Lightning این ویڈیا کا تیار کردہ 30B پیرامیٹرز والا اوپن سورس MoE ماڈل ہے، جسے کثیر ایجنٹ نظاموں کے لیے بہتر بنایا گیا ہے۔ ہم نوع ماڈلز کے مقابلے میں آؤٹ پٹ کی رفتار 4 گنا زیادہ ہے، ایجنٹ کے کاموں کی تکمیل کی رفتار 30% بڑھ جاتی ہے، جبکہ...00
Wan-Animate-2 – وان-اینیمیٹ ٹیم کا اوپن سورس کردہ نئی نسل کا کردار اینیمیشن ماڈلاینیمیشن سازیWan-Animate-2 وان-اینیمیٹ ٹیم کا اوپن سورس کردہ نئی نسل کا کردار اینیمیشن ماڈل ہے۔ یہ Wan-Animate کا ایک اہم آرکیٹیکچرل اپ گریڈ ہے، جو اینڈ ٹو اینڈ دو شاخہ DiT استعمال کرتا ہے اور واضح پوز اسکیلیٹن کے بغیر حوالہ جاتی ویڈیو سے حرکتی پیشگی معلومات حاصل کر سکتا ہے۔ یہ ڈرائیونگ ویڈیو کو کردار اینیمیشن میں تبدیل کرنے، شناخت اور ظاہری شکل برقرار رکھنے، اور متن کے ذریعے زاویۂ نظر کنٹرول کرنے کی سہولت دیتا ہے۔ اس میں Base اعلیٰ معیار اور Distillation کم مراحل والی دو inference modes فراہم کی گئی ہیں، جبکہ حقیقی وقت میں اسٹریمنگ کردار اینیمیشن کے لیے Lite variant بھی پیش کیا گیا ہے۔ یہ ماڈل ورچوئل اینکرز، مختصر ویڈیو تخلیق اور ڈیجیٹل انسانوں جیسے استعمال کے لیے موزوں ہے، اور اس کا مقصد حرکت کی وفاداری اور شناخت کی یکسانیت بیک وقت بہتر بنانا، نیز تخلیق میں تاخیر کم کرنا ہے۔00
SenseNova U1.5-Lite-Preview – شانتانگ کا اوپن سورس ہلکا پھلکا ملٹی موڈل ماڈلAI بڑا ماڈلSenseNova U1.5-Lite-Preview – شانتانگ کا اوپن سورس ہلکا پھلکا ملٹی موڈل ماڈل NEO-Unify آرکیٹیکچر پر مبنی ہے اور 8B-MoT پیرامیٹرز کے ذریعے بصری فہم، استدلال، جنریشن اور ایڈیٹنگ کو مقامی طور پر یکجا کرتا ہے۔ ماڈل مقامی طور پر 4K الٹرا ہائی ڈیفینیشن تصاویر تیار کرتا ہے، باریک ساخت، حقیقی احساس اور چینی و انگریزی میں پیچیدہ لے آؤٹ کے متن کی رینڈرنگ کی صلاحیت رکھتا ہے۔ اس میں Prompt Enhance Skill شامل ہے، جو تخلیق کی رکاوٹ کم کرتا ہے، طویل قدرتی زبان اور ساختی بصری ہدایات کو درست طور پر نافذ کرتا ہے اور مسلسل تکراری ایڈیٹنگ کی معاونت فراہم کرتا ہے۔ ڈیزائنرز، ڈویلپرز اور مواد تخلیق کاروں کے لیے یہ کم تعیناتی لاگت اور اعلیٰ ہدایات پر عمل درآمد کے ساتھ تجارتی معیار کا بصری تخلیقی ٹول فراہم کرتا ہے۔10
IndexTTS-2.5AI آواز کی ترکیبIndexTTS-2.5، Bilibili کا اوپن سورس صنعتی معیار کا زیرو شاٹ وائس کلوننگ ماڈل ہے، جس کے پیرامیٹرز کی تعداد صرف 0.8B ہے۔ یہ چینی، انگریزی، جاپانی، ہسپانوی اور عربی، یعنی پانچ زبانوں کے درمیان کراس لِنگوئل منتقلی کو سپورٹ کرتا ہے۔00
MAGI-2-preview – Sand.ai کا اوپن سورس ملٹی موڈل ویڈیو جنریشن ماڈلAI ویڈیو جنریشنMAGI-2-preview – Sand.ai کا اوپن سورس ملٹی موڈل ویڈیو جنریشن ماڈل، Sand.ai کا اوپن سورس دنیا کا پہلا ایک سو ارب پیرامیٹرز والا MoE ملٹی موڈل ویڈیو جنریشن ماڈل ہے، جس کے کل پیرامیٹرز 114B اور فعال پیرامیٹرز صرف 6B ہیں۔ یہ ماڈل سنگل اسٹریم آرکیٹیکچر کو برقرار رکھتے ہوئے متن، ویڈیو اور آڈیو کو ایک ہی Transformer میں متحد کر کے مشترکہ ماڈلنگ کرتا ہے، جس سے مقامی ملٹی موڈل جنریشن ممکن ہوتی ہے۔ اس کی بنیادی خصوصیات میں متن، تصویر اور ویڈیو سے ویڈیو جنریشن، نیز آڈیو کی تفہیم کا مقامی انضمام شامل ہے، جبکہ MoE کی sparse activation کے ذریعے inference کی لاگت نمایاں طور پر کم کی جاتی ہے۔ اس کا ہدف AI محققین، ڈویلپرز اور کاروباری ٹیکنالوجی ٹیمیں ہیں۔ یہ علمی تحقیق، نجی تعیناتی اور ملٹی موڈل فلم و ٹی وی پری ویژولائزیشن جیسے منظرناموں کے لیے موزوں ہے، اور اوپن سورس، تجارتی استعمال کے قابل مؤثر ویڈیو جنریشن حل فراہم کرتا ہے۔00
Qwen-CUA – علی بابا کے Qwen وغیرہ کی جانب سے پیش کردہ مقامی Computer Use AgentAI انٹیلی جنٹ ایجنٹQwen-CUA – علی بابا کے Qwen وغیرہ کی جانب سے پیش کردہ مقامی Computer Use Agent، 397B-A17B مخلوط ماہرین کے معماری ڈھانچے پر مبنی ہے۔ یہ صرف اسکرین شاٹس کے ذریعے انٹرفیس کی حالت کو محسوس کرتا ہے اور DOM ٹری یا رسائی کی میٹا ڈیٹا پر انحصار کیے بغیر براہِ راست کی بورڈ اور ماؤس ایونٹس خارج کرکے براؤزر، ڈیسک ٹاپ اور پیشہ ورانہ سافٹ ویئر کو کنٹرول کر سکتا ہے۔ OSWorld-Verified بینچ مارک میں اس نے 86.2 اسکور حاصل کیا، جبکہ بڑے ورژن Qwen-CUA-Max نے 87.6 اسکور حاصل کیا، جو اوپن سورس CUA کے شعبے میں अग्रणी سطح ہے۔ یہ اینڈ ٹو اینڈ بصری-عملی تربیت استعمال کرتا ہے، مختلف پلیٹ فارمز پر عمومی مطابقت اور اعلیٰ استحکام رکھتا ہے، اور اس کی تکنیکی رپورٹ اور Demo اوپن سورس کی جا چکی ہیں۔ یہ خودکار ٹیسٹنگ، RPA، رسائی معاونت اور تحقیقی سافٹ ویئر کنٹرول جیسے منظرناموں کے لیے موزوں ہے۔00
SALMONN-2 – سنگھوا یونیورسٹی وغیرہ کا اوپن سورس عمومی آڈیو بڑا زبان ماڈلAI پروگرامنگSALMONN-2 – سنگھوا یونیورسٹی وغیرہ کا اوپن سورس عمومی آڈیو بڑا زبان ماڈل، بائٹ ڈانس کے SPEAR متحدہ خود زیرِ نگرانی آڈیو انکوڈر اور کثیر سطحی خصوصیات کے امتزاج والے اڈاپٹر پر مبنی ہے، جبکہ متن کے بنیادی ماڈل کے طور پر Qwen3 استعمال کرتا ہے۔ یہ تقریر کی شناخت، آڈیو کی وضاحت، موسیقی کی تفہیم، جذبات کی شناخت، مقرر کی تصدیق جیسے بین المجال کاموں کو سپورٹ کرتا ہے، اور پہلی بار عمومی ALLM میں آواز کے واقعات کی شناخت، آڈیو جعل سازی کی شناخت، تقریری معیار کی جانچ اور کثیر الوسائطی سیاقی تقریر کی شناخت جیسی جدید صلاحیتوں کو منظم طور پر نافذ کرتا ہے۔ یہ ماڈل روایتی دوہرے انکوڈر کے طریقے کی جگہ واحد SPEAR انکوڈر استعمال کرتا ہے اور MLF اڈاپٹر کے ذریعے کثیر سطحی صوتی خصوصیات کو یکجا کرتا ہے، جس سے بین المجال کارکردگی زیادہ متوازن ہوتی ہے۔ صرف تقریباً 1.8万 گھنٹے کے زیرِ نگرانی ڈیٹا کی مؤثر تربیت کے باعث SALMONN-2 نے MMAU-Pro، MMAR اور MMSU کے تین بڑے جامع معیارات پر ہم حجم اوپن سورس ماڈلز میں بہترین کارکردگی حاصل کی ہے۔ یہ ذہین میٹنگ معاون، آڈیو مواد کی جانچ اور تقریری معیار کی نگرانی جیسے منظرناموں کے لیے موزوں ہے۔00
Muse Glimmer – Meta کا اوپن سورس 30 ارب پیرامیٹرز والا بڑا زبان ماڈلAI انٹیلی جنٹ ایجنٹMuse Glimmer، Meta کا اوپن سورس 30 ارب پیرامیٹرز والا بڑا زبان ماڈل ہے، جسے چوبیس گھنٹے مقامی طور پر مستقل چلنے والے Agent ورک فلو کے لیے گہرائی سے بہتر بنایا گیا ہے۔ 4bit کوانٹائزیشن کے ذریعے یہ ماڈل 24GB ویڈیو میموری والے سنگل GPU یا 32GB یونیفائیڈ میموری والے Apple Silicon (M4/M5 Max) پر روانی سے چل سکتا ہے، جبکہ کارکردگی میں کمی تقریباً نہ ہونے کے برابر رہتی ہے۔ اس میں DFlash speculative decoding شامل ہے، جو RTX 5090 جیسے اعلیٰ درجے کے ہارڈویئر پر زیادہ سے زیادہ 3.1 گنا رفتار فراہم کرتا ہے۔ یہ حقیقی وقت کی گفتگو، ٹول کالنگ، کوڈ جنریشن اور کثیر مرحلہ استدلال سمیت کثیر الوسائط کاموں کو سپورٹ کرتا ہے۔ یہ انفرادی ڈویلپرز، چھوٹے اور درمیانے درجے کے کاروباروں، نیز طبی اور مالیاتی شعبوں کے لیے موزوں ہے جہاں ڈیٹا کی رازداری اہم ہو۔ یہ کم ویڈیو میموری کی ضرورت کے ساتھ مقامی اور مؤثر AI صلاحیت فراہم کرتا ہے، جبکہ تمام ڈیٹا ڈیوائس کے اندر ہی رہتا ہے۔00
Hunyuan3D-Buffalo 1.0 – Tencent Hunyuan کا 3D ملٹی موڈل فریم ورک3D ڈیزائنHunyuan3D-Buffalo 1.0 – Tencent Hunyuan کا 3D ملٹی موڈل فریم ورک، Tencent Hunyuan کا تیار کردہ متحدہ 3D ملٹی موڈل فریم ورک ہے، جو مشترکہ Hunyuan3D-VLM بنیادی ماڈل کے ذریعے 3D سوال و جواب، مکانی تعیین، متن سے 3D تخلیق، ہدایتی تدوین اور پرزوں کی تخلیق کو ایک ہی عمل میں یکجا کرتا ہے۔ یہ فریم ورک قدرتی زبان کے ذریعے 3D ماڈل کی ساخت سمجھنے، پرزوں کی تعیین، ہدایات کے مطابق مقامی جیومیٹری میں ترمیم اور معنوی سطح کے پرزے اخذ کرنے کی سہولت دیتا ہے۔ اس کا مقصد 3D تفہیم، تخلیق اور تدوین کے مکمل چکر کو مربوط کرنا اور گیمز، اینیمیشن اور صنعتی ڈیزائن کے لیے قابلِ ترکیب 3D اثاثہ سازی کا حل فراہم کرنا ہے۔ بنیادی خصوصیات میں 3D تفہیم، متن سے 3D تخلیق، ہدایتی تدوین اور پرزوں کی تخلیق شامل ہیں، جبکہ چاروں اقسام کے کام ایک ہی 3D معنوی نمائندگی اور پراسیسنگ پائپ لائن استعمال کرتے ہیں۔ یہ گیم ڈویلپرز، اینیمیشن سازوں، صنعتی ڈیزائنرز اور 3D مواد تخلیق کاروں کے لیے موزوں ہے؛ قدرتی زبان کے ذریعے پیشہ ورانہ مہارت کی ضرورت کم ہوتی ہے اور اثاثوں کے دوبارہ استعمال اور تکراری بہتری کی کارکردگی بڑھتی ہے۔00
ShotcutAI ویڈیو ایڈیٹنگShotcut، FFmpeg پر مبنی اوپن سورس ویڈیو ایڈیٹنگ سافٹ ویئر ہے، جو مکمل طور پر مفت ہے اور اس میں واٹرمارک یا دورانیے کی کوئی پابندی نہیں۔ یہ سافٹ ویئر سیکڑوں آڈیو اور ویڈیو فارمیٹس کو درآمد کیے بغیر براہِ راست ایڈٹ کرنے، ملٹی ٹریک ٹائم لائن، کی فریم اینیمیشن اور متعدد...00
WorldClaw – ٹینسینٹ ہنیوان ٹیم کا 3D دنیا جنریشن فریم ورک3D ڈیزائنWorldClaw ٹینسینٹ ہنیوان ٹیم کا Agent پر مبنی اوپن ورلڈ 3D جنریشن فریم ورک ہے۔ صارف ایک جملے میں قدرتی زبان کی تفصیل لکھتا ہے، نظام خود بخود خطہ، علاقے، عمارتیں، اشیاء اور مکانی تعلقات کی منصوبہ بندی کرتا ہے، کل سے جزو کی جنریشن حکمت عملی اپناتے ہوئے Blender میں آزادانہ طور پر گھومنے اور ہر شے کی علیحدہ تدوین کے قابل مکمل 3D منظر تیار کرتا ہے۔ فریم ورک Claude Opus، GPT-Image-2، SAM3 اور Hunyuan3D جیسے متعدد ماڈلز کے اشتراک سے چلتا ہے، بصری Agent کی خود جانچ اور مرمت کی صلاحیت رکھتا ہے، اور معلق اشیاء یا ماڈل میں گھسنے جیسے رابطے کے مسائل خود بخود درست کرتا ہے۔00
PyTorchAI پروگرامنگ ٹولزPyTorch ایک اوپن سورس مشین لرننگ فریم ورک ہے، جسے Meta AI کی تحقیقی ٹیم نے شروع کیا تھا اور اب Linux Foundation اس کا انتظام کرتی ہے۔ یہ بنیادی طور پر مصنوعی ذہانت کے محققین، مشین لرننگ انجینئرز، ڈیٹا سائنس دانوں اور طلبہ کے لیے بنایا گیا ہے۔ صارفین عموماً Python کے ذریعے ماڈلز اور فارورڈ کمپیوٹیشن کے عمل کی تعریف کرتے ہیں، پھر ٹینسر کمپیوٹیشن، خودکار تفریق اور نیورل نیٹ ورک ماڈیولز کی مدد سے تربیت مکمل کرتے ہیں، جبکہ متعلقہ ایکو سسٹم لائبریریوں کے ذریعے بصری، آڈیو یا متنی کام انجام دیتے ہیں۔ ڈائنامک کمپیوٹیشن گراف تجربات اور ڈیبگنگ کو آسان بناتا ہے اور تحقیقی پروٹوٹائپ سے ماڈل کی تعیناتی تک پیش رفت کی سہولت دیتا ہے۔ عملی استعمال کے لیے Python، ٹینسر آپریشنز اور ڈیپ لرننگ کی بنیادی سمجھ ضروری ہے؛ تجرباتی کوڈ کو پروڈکشن ماحول میں منتقل کرتے وقت انجینئرنگ تعیناتی اور وسائل کی ترتیب خود سنبھالنی پڑتی ہے۔057.6
Qwen 3.8-Max – علی بابا کلاؤڈ کی Qwen ٹیم کا پیش کردہ فلیگ شپ بڑا ماڈلAI بڑا ماڈلQwen 3.8-Max – علی بابا کلاؤڈ کی Qwen ٹیم کا پیش کردہ فلیگ شپ بڑا ماڈل، Qwen 3.5 آرکیٹیکچر کی بنیاد پر پھیلا کر 2.4 ٹریلین پیرامیٹرز تک پہنچایا گیا ہے اور اسے کاروباری و سائنسی تحقیق کے لیے انتہائی بڑے پیمانے کے لسانی ماڈل کے طور پر پیش کیا گیا ہے۔ یہ طویل مدتی خودکار پروگرامنگ، تحقیقی مقالوں کی ازسرنو تنفیذ، مقابلہ جاتی عملی استعمال، دفتری کارکردگی میں اضافہ، مقداری حکمتِ عملی کی تحقیق و ترقی اور چِپ کے خودکار ڈیزائن جیسے کئی اعلیٰ قدر والے منظرناموں کی معاونت کرتا ہے۔ ماڈل حقیقی دنیا کی تقویتی تعلیم اور خود ارتقائی فیڈبیک لوپ کے ذریعے کئی دنوں سے کئی دسیوں دنوں تک خودکار طور پر کام انجام دیتا ہے، اور انسانی مداخلت کے بغیر پیچیدہ کام مکمل کر سکتا ہے۔ صارفین Qwen AI پلیٹ فارم کے ذریعے OpenAI یا Anthropic پروٹوکول سے مطابقت رکھنے والی API کال کر سکتے ہیں، یا اوپن سورس وزن مقامی طور پر تعینات کر سکتے ہیں، جس سے Claude Code، Codex، Qoder جیسے ایجنٹ فریم ورکس میں آسان انضمام ممکن ہوتا ہے۔ اس طرح تحقیق و ترقی کی ٹیمیں، قانونی و تعمیری تعمیل کے ماہرین، ڈیزائنرز اور دیگر پیشہ ور صارفین اپنی کارکردگی نمایاں طور پر بہتر بنا سکتے ہیں اور طویل مدتی منصوبوں کی تکمیل ایک ہی گفتگو میں کر سکتے ہیں۔10اس ٹیگ والے تمام ٹولز دکھائے گئے ہیں۔
