মূল কনটেন্টে যান

LTX-2.5 চালু আছে

LTX-2.5 হলো LTX-এর ওপেন-সোর্স AI ভিডিও জেনারেশন বেস মডেল, যাতে 22B প্যারামিটার রয়েছে এবং প্রকাশের সময়ই ওজন উন্মুক্ত করা হয়েছে। মডেলটি নেটিভ মাল্টি-শট জেনারেশন, 4K HDR ও RAW/EXR পেশাদার ওয়ার্কফ্লো সমর্থন করে, একই সঙ্গে অডিওও তৈরি করতে পারে,具...

LTX-2.5 হলো LTX-এর ওপেন-সোর্স AI ভিডিও জেনারেশন বেস মডেল, যাতে 22B প্যারামিটার রয়েছে এবং প্রকাশের সময়ই ওজন উন্মুক্ত করা হয়েছে। মডেলটি নেটিভ মাল্টি-শট জেনারেশন, 4K HDR ও RAW/EXR পেশাদার ওয়ার্কফ্লো সমর্থন করে, একই সঙ্গে অডিওও তৈরি করতে পারে,具...

LTX-2.5 পণ্যের ইন্টারফেস
মাসিক ভিজিট
0
মূল্য
বিনামূল্যে এবং পে করুন
তালিকাভুক্ত
2026-08-13
আপডেট করা হয়েছে
2026-08-13

01LTX-2.5 কী

LTX-2.5 হলো LTX-এর ওপেন-সোর্স AI ভিডিও জেনারেশন বেস মডেল, যাতে 22B প্যারামিটার রয়েছে এবং প্রকাশের সময়ই ওজন উন্মুক্ত করা হয়েছে। মডেলটি নেটিভ মাল্টি-শট জেনারেশন, 4K HDR ও RAW/EXR পেশাদার ওয়ার্কফ্লো সমর্থন করে, একই সঙ্গে অডিওও তৈরি করতে পারে এবং নির্ভুল ভিডিও সম্পাদনার সুবিধা দেয়। ক্লোজড-সোর্স মডেলগুলোর দাম ক্রমশ বাড়তে থাকা অবস্থায়, LTX-2.5-এর ওপেন ইকোসিস্টেম কৌশল AI ভিডিও ক্ষেত্রে পেশাদার মানের একটি ওপেন-সোর্স বিকল্প প্রদান করে।

02LTX-2.5-এর প্রধান ফিচার

নেটিভ মাল্টি-শট জেনারেশন: একবার জেনারেট করেই বিভিন্ন ক্যামেরা অ্যাঙ্গেল ও শট সাইজের একাধিক ধারাবাহিক শট তৈরি করা যায়। শট পরিবর্তনের মধ্যেও চরিত্রের চেহারা, পরিবেশের আবহ, আলোর অবস্থা ও শব্দের সামঞ্জস্য বজায় থাকে, ফলে AI গল্প নির্মাণে শটের ধারাবাহিকতার মূল সমস্যার সমাধান হয়।
ডিফিউশন ফিডেলিটি রেন্ডারিং: দৃশ্যের জটিলতা অনুযায়ী রেন্ডারিং ক্ষমতা স্বয়ংক্রিয়ভাবে বণ্টন করে। জটিল গতিশীল শট বেশি কম্পিউটিং রিসোর্স পায়, আর স্থির বা সহজ দৃশ্যে স্বয়ংক্রিয়ভাবে রিসোর্স সাশ্রয় হয়। এতে ছবির মান বজায় রেখেই সামগ্রিক দক্ষতা বাড়ে।
নির্ভুল ভিডিও সম্পাদনা: মূল লাইভ-অ্যাকশন ফুটেজের গতিপথ ও স্থানিক কাঠামো বজায় রেখে উচ্চ নির্ভুলতায় স্টাইল পরিবর্তন, দৃশ্য পুনরায় আঁকা ও চরিত্র প্রতিস্থাপন করা যায়। এর মাধ্যমে “লাইভ-অ্যাকশন কাঠামো + AI স্টাইলাইজড ওভারলে”-ভিত্তিক নিয়ন্ত্রিত সৃজন সম্ভব।
স্বয়ংক্রিয় দৈর্ঘ্য পূর্বাভাস: অন্তর্নির্মিত Duration Head মডিউল প্রম্পটের অ্যাকশন বর্ণনা পড়ে উপযুক্ত ক্লিপের দৈর্ঘ্য স্বয়ংক্রিয়ভাবে নির্ধারণ করে, ফলে নির্মাতাকে বারবার পরীক্ষা করতে হয় না।
পেশাদার আউটপুট ফরম্যাট: নেটিভ 4K HDR, RAW ও EXR লসলেস ফরম্যাটে আউটপুট সমর্থন করে, যা সরাসরি পেশাদার চলচ্চিত্রের কালার গ্রেডিং, ভিএফএক্স কম্পোজিটিং ও পোস্ট-প্রোডাকশন এডিটিং পাইপলাইনে যুক্ত করা যায়।
সিঙ্ক্রোনাইজড অডিও জেনারেশন: স্বতন্ত্র Audio VAE মডিউলের মাধ্যমে ভিডিওর সঙ্গে সামঞ্জস্যপূর্ণ অডিও ট্র্যাক তৈরি করে।
IC-LoRA নির্ভুল নিয়ন্ত্রণ: Canny edge, Depth depth ও Pose posture-ভিত্তিক তিন ধরনের রেফারেন্স ভিডিও কন্ট্রোল মোড দেয়, যাতে জেনারেট করা ফল রেফারেন্স উপাদানের কম্পোজিশন, স্থানিক কাঠামো বা চরিত্রের গতিবিধি কঠোরভাবে অনুসরণ করে।

03LTX-2.5-এর প্রযুক্তিগত নীতি

WeChat-এ ফলো করে “ওপেন-সোর্স” লিখে উত্তর পাঠান, AI ওপেন-সোর্স প্রকল্পের আলোচনা গ্রুপে যোগ দিন
Gemma 4 12B টেক্সট এনকোডার: Lightricks-এর LTX-এর জন্য কাস্টমাইজ করা বৃহৎ ভাষা মডেল এনকোডার। এটি দীর্ঘ ও জটিল প্রম্পটের একাধিক বিষয়ের সম্পর্ক, অ্যাকশনের বিবরণ, আলোর বর্ণনা ও ক্যামেরার দিক সম্পূর্ণভাবে ধরে রাখতে পারে; প্রম্পট দীর্ঘ হলেও উপবাক্যের তথ্য হারায় না।
Prompt Enhancer: একটি হালকা সহায়ক মডেল, যা ব্যবহারকারীর সংক্ষিপ্ত ইনপুটকে স্বয়ংক্রিয়ভাবে বিস্তারিত সিনেমাটিক নির্দেশনায় রূপান্তর করে। এটি প্রম্পট ইঞ্জিনিয়ারিংয়ের প্রবেশ-সীমা কমায় এবং খুব কম কম্পিউটিং খরচে কাজ করে।
Diffusion Video Decoder: প্রচলিত VAE ডিকোডারের বিকল্প একটি নতুন আর্কিটেকচার, যা দ্রুত গতির দৃশ্যের জন্য বিশেষভাবে অপ্টিমাইজ করা। এটি ছবির মাখামাখি ভাব ও আর্টিফ্যাক্ট উল্লেখযোগ্যভাবে কমায়, ফলে মুখ আরও স্পষ্ট এবং লেখা আরও পাঠযোগ্য হয়।
Audio VAE: স্বতন্ত্র অডিও ল্যাটেন্ট-স্পেস এনকোডার, যা ভিডিওর বিষয়বস্তুকে সামঞ্জস্যপূর্ণ অডিও উপস্থাপনায় রূপান্তর করে এবং ছবি ও শব্দের সমকালীন জেনারেশন সম্ভব করে।
Diffusion Fidelity Rendering: “আগে কাঠামো, পরে বিবরণ” দুই-ধাপের রেন্ডারিং কৌশল ব্যবহার করে। প্রথম ধাপে 8× টাইম কমপ্রেশনযুক্ত ল্যাটেন্ট স্পেসে গতি, কম্পোজিশন ও শটের কাঠামো তৈরি করা হয় এবং উচ্চ-নির্ভুলতার কীফ্রেম স্বয়ংক্রিয়ভাবে জেনারেট করা হয়। দ্বিতীয় ধাপে কাঠামো ও কীফ্রেম একসঙ্গে ডিফিউজ করে চূড়ান্ত ভিডিও রেন্ডার করা হয়, যাতে পিক্সেল-স্তরের নির্ভুলতায় টেক্সচার, উপাদান ও মুখের বিবরণ বিশ্লেষণ করা যায়।
Duration Head: ডিফিউশন প্রক্রিয়ার আগে স্থাপিত একটি পূর্বাভাস মডিউল। এটি প্রম্পটের অ্যাকশন-সংক্রান্ত অর্থ বুঝে স্বয়ংক্রিয়ভাবে উপযুক্ত ভিডিও দৈর্ঘ্য অনুমান ও নির্ধারণ করে, ফলে মডেল প্রাথমিকভাবে বর্ণনার গতি উপলব্ধি করতে পারে।

04LTX-2.5 কীভাবে ব্যবহার করবেন

পথ নির্বাচন: API ক্লাউড পরিষেবা ব্যবহার করবেন, নাকি ComfyUI স্থানীয়ভাবে ডিপ্লয় করবেন, তা নির্ধারণ করুন।
API সংযোগ: LTX-এর অফিসিয়াল ওয়েবসাইটে API Key-এর জন্য আবেদন করুন এবং API কল করতে Fast বা Pro স্তর বেছে নিন।
নোড ইনস্টল: স্থানীয় ডিপ্লয়ের জন্য ComfyUI-কে সর্বশেষ সংস্করণে আপডেট করুন এবং Manager-এর মাধ্যমে ComfyUI-LTXVideo নোড প্যাকেজ ইনস্টল করুন।
মডেল ডাউনলোড: ComfyUI টেমপ্লেট ব্রাউজারে “LTX-2.5″ অনুসন্ধান করুন, সংশ্লিষ্ট ওয়ার্কফ্লো নির্বাচন করে এক ক্লিকেই সব মডেল ফাইল ডাউনলোড করুন।
প্যারামিটার কনফিগার: প্রস্থ ও উচ্চতা 32-এর গুণিতক, ফ্রেম সংখ্যা 1+8-এর গুণিতক এবং ফ্রেম রেট 24/25/48/50fps নির্ধারণ করুন। 2× আপস্কেলিং চালু করতে বেস রেজোলিউশন লক্ষ্যের অর্ধেক রাখুন।
প্রম্পট লিখুন: একটানা গদ্যে শটের আকার, দৃশ্যের আলো, চরিত্রের অ্যাকশন, ক্যামেরার গতি ও অডিও বর্ণনা করুন; ট্যাগের স্তূপ বা ওজন-ভিত্তিক সিনট্যাক্স এড়িয়ে চলুন।
জেনারেশন চালান: রান ক্লিক করুন। টেক্সট-টু-ভিডিও সরাসরি ভিডিও তৈরি করবে, ইমেজ-টু-ভিডিওতে প্রথম ফ্রেম আপলোড করতে হবে, আর প্রথম-ও-শেষ-ফ্রেম মোডে প্রথম ও শেষ উভয় ফ্রেম আপলোড করতে হবে।
নির্ভুল নিয়ন্ত্রণ: উন্নত ব্যবহারকারীরা Canny, Depth বা Pose মোডের IC-LoRA লোড করে রেফারেন্স ভিডিও যুক্ত করতে পারেন, যাতে কম্পোজিশন বা অ্যাকশন লক করা যায়।
মডেল নির্বাচন: দ্রুত পুনরাবৃত্তির জন্য distilled মডেল এবং চূড়ান্ত ভিডিওর জন্য সম্পূর্ণ dev মডেল ব্যবহার করুন, যাতে আরও সূক্ষ্ম বিবরণ পাওয়া যায়।

05LTX-2.5-এর মূল সুবিধা

বর্ণনার ধারাবাহিকতা: নেটিভ Multishot মাল্টি-শট জেনারেশন একবারের আউটপুটেই চরিত্রের চেহারা, পরিবেশের আবহ, আলোর অবস্থা ও শব্দের উচ্চ সামঞ্জস্য বজায় রাখতে পারে। এটি AI গল্প নির্মাণে শটের ধারাবাহিকতার সবচেয়ে বড় সমস্যার মৌলিক সমাধান দেয়।
নিয়ন্ত্রণে বড় উন্নতি: নির্ভুল ভিডিও সম্পাদনা মূল লাইভ-অ্যাকশন ফুটেজের গতিপথ ও স্থানিক কাঠামো ধরে রাখে। Canny/Depth/Pose তিন ধরনের IC-LoRA কন্ট্রোল মোডের সঙ্গে মিলিয়ে এটি “অন্ধভাবে ফল বাছাই” থেকে “লাইভ-অ্যাকশন কাঠামো + AI স্টাইলাইজড ওভারলে”-ভিত্তিক নিয়ন্ত্রিত উৎপাদনে রূপান্তর ঘটায়।
ইন্ডাস্ট্রিয়াল-গ্রেড ওয়ার্কফ্লো: নেটিভ RAW/HDR/EXR আউটপুট সরাসরি পেশাদার কালার গ্রেডিং, ভিএফএক্স কম্পোজিটিং ও পোস্ট-প্রোডাকশন এডিটিং পাইপলাইনে যুক্ত করা যায়। কমপ্রেশন বা ট্রান্সকোডিংয়ের প্রয়োজন নেই, তাই চলচ্চিত্র শিল্পের লসলেস উপাদানের কঠোর চাহিদা পূরণ হয়।
অ্যাডাপটিভ দক্ষতা: Diffusion Fidelity Rendering প্রযুক্তি দৃশ্যের জটিলতা অনুযায়ী রেন্ডারিং ক্ষমতা গতিশীলভাবে বণ্টন করে। জটিল গতিশীল শট সূক্ষ্মভাবে রেন্ডার হয়, আর স্থির সহজ দৃশ্যে স্বয়ংক্রিয়ভাবে রিসোর্স সাশ্রয় হয়। এতে পিক্সেল-স্তরের ছবির মান বজায় রেখেই সামগ্রিক জেনারেশন দক্ষতা বাড়ে।

06LTX-2.5-এর প্রকল্প ঠিকানা

প্রকল্পের অফিসিয়াল ওয়েবসাইট: https://ltx.io/model/ltx-2-5
HuggingFace মডেল লাইব্রেরি: https://huggingface.co/Lightricks/LTX-2.5

07LTX-2.5-এর প্রয়োগক্ষেত্র

পেশাদার চলচ্চিত্র পোস্ট-প্রোডাকশন: নেটিভ 4K HDR, RAW ও EXR লসলেস আউটপুট সরাসরি কালার গ্রেডিং, ভিএফএক্স কম্পোজিটিং ও এডিটিং পাইপলাইনে যুক্ত করা যায়। এটি প্রেক্ষাগৃহ ও স্ট্রিমিং-মানের পোস্ট-প্রোডাকশনের চাহিদা পূরণ করে এবং কমপ্রেসড MP4-এর কালার গ্রেডিংয়ের সীমাবদ্ধতা এড়ায়।
AI শর্ট ড্রামা ও অ্যানিমেটেড গল্প: Multishot মাল্টি-শট জেনারেশন একবারেই ধারাবাহিক বর্ণনার স্টোরিবোর্ড তৈরি করে। নির্ভুল ভিডিও সম্পাদনা “বাস্তব মানুষের অ্যাকশনের কাঠামো + AI চরিত্র প্রতিস্থাপন ও স্টাইলাইজড ওভারলে” সমর্থন করে, ফলে শটের ধারাবাহিকতা ও অ্যাকশন নিয়ন্ত্রণের দুটি বড় সমস্যা মৌলিকভাবে সমাধান হয়।
বিজ্ঞাপন ও ব্র্যান্ড কনটেন্ট: উচ্চমানের বাণিজ্যিক ভিডিও দ্রুত পুনরাবৃত্তিতে তৈরি করা যায়। Prompt Enhancer প্রম্পট ইঞ্জিনিয়ারিংয়ের প্রবেশ-সীমা কমায়, Distilled মডেল দ্রুত প্রিভিউ সমর্থন করে এবং সম্পূর্ণ মডেল চূড়ান্ত ভিডিও আউটপুট দেয়, ফলে দক্ষতা ও মানের ভারসাম্য বজায় থাকে।
ফিজিক্যাল AI ও রোবোটিক্স: Physical AI Checkpoint embodied intelligence দলগুলোকে ওয়ার্ল্ড মডেলের ভিত্তি প্রদান করে। এটি রোবট সিস্টেমকে ভৌত জগত ও গতির নিয়ম উপলব্ধি করতে সহায়তা করে এবং নিছক কনটেন্ট সৃষ্টির সীমা অতিক্রম করে।

© দাবিত্যাগ: সময়ের সঙ্গে ডোমেইন ও লিংক করা কনটেন্ট পরিবর্তিত হতে পারে। AIEZZ তৃতীয় পক্ষের ওয়েবসাইট নিয়ন্ত্রণ করে না। বাহ্যিক কনটেন্ট ও ঝুঁকি স্বাধীনভাবে পর্যালোচনা করুন।

ব্যবহারকারীর রিভিউ0