メインコンテンツへ移動

オープンソースモデル

AIEZZのツールタグ

「オープンソースモデル」タグのAI製品を閲覧中。8件の検索結果があります。

LongCatAIチャット対話LongCatは美団が提供するオープンソースの大規模言語モデルです。5600億パラメータのMixture-of-Expertsアーキテクチャを採用し、実行時には約270億パラメータを動的に活性化して、テキスト理解、複雑な推論、対話タスクに対応します。長文ドキュメントや継続的な対話をモデルに処理させることができ、開発者、企業ユーザー、人工知能研究者による文書分析、コード支援、数学的推論、インテリジェントエージェントのワークフローの検証に適しています。LongCatは最大128k文字の入力に対応し、無料で利用する方法も提供しています。ただし、実際の性能、応答速度、導入コストは、タスクの種類、実行環境、具体的な呼び出し方法によって異なります。138.5JanusAI画像生成ツールJanusは、画像制作とビジュアルコンテンツ理解を目的としたマルチモーダルAI画像生成ツールです。資料によると現在運用中で、無料で利用できる方法が提供されています。ユーザーはテキストプロンプトから画像を生成できるほか、画像理解機能を使って画面を分析したり、学術図表の情報を抽出したり、数式をLaTeXコードに変換したりできます。ビジュアルクリエイター、研究者、開発者、メディア編集者、教育・研修担当者などが、コンセプトスケッチ、挿絵制作、図表の読み取り、数式の整理に活用できます。実際の利用時には、生成画像の細部、図表の認識結果、コードの正確性をユーザーが確認する必要があります。077.6DiffRhythmAIオーディオツールDiffRhythmは、西北工業大学ASLP研究室が開発したAI楽曲生成モデルです。潜在拡散モデルを採用し、音楽のデモ音源やBGMを素早く制作したいクリエイター、またはモデル研究に取り組む開発者を対象としています。歌詞とスタイルプロンプトを入力すると、ボーカルと伴奏を含むフル楽曲を生成できます。1回の生成で最長約4分45秒の楽曲に対応し、中国語と英語の楽曲を生成できます。オープンソースモデルと推論コードが提供されており、体験、研究、二次開発に適しています。生成結果は手作業による選別、修正、または後処理が必要になる場合があり、実際の品質は歌詞やスタイルプロンプトの内容にも左右されます。018.5K2 ThinkAIチャット対話K2 Thinkは、アラブ首長国連邦のムハンマド・ビン・ザーイド人工知能大学とG42が共同で提供するオープンソースの推論モデルで、複雑な論理、数学的問題、専門分野の質問応答への対応を目的としています。モデルのパラメータ規模は320億で、コード生成のほか、物理学や化学などの分野に関する知識質問にも対応します。ユーザーは対話画面から質問を入力し、回答に基づいて追加質問を続けられるため、開発者、研究者、教育関係者、分析型の対話を必要とする専門ユーザーに適しています。資料によると、毎秒2,000トークンを超える推論速度を実現でき、比較的高いパラメータ効率も重視されています。実際の回答については、特に数学、研究、金融など高い正確性が求められる場面では、引き続き人による確認が必要です。038.3Liquid AIAIツールボックスLiquid AIは、エッジデバイス向けのAIツールボックスです。中核製品のLiquid Foundation Models(LFMs)は、350Mから2.6Bまでのパラメータ規模をカバーし、テキスト、ビジョン・ランゲージ、音声などのモデル形態に対応しています。開発者はLEAPプラットフォームを通じて、モデルのダウンロード、微調整、デバイスへの展開を行えるほか、Apolloモバイルアプリでローカルテストを実施できます。独立系開発者、スタートアップ、研究者、ハードウェアメーカー、カスタムソリューションを必要とする企業を対象としており、スマートフォン、ノートパソコン、自動車、ロボットなどの端末に利用できます。モデルはHugging Faceから入手できますが、実際の性能はハードウェア条件、モデル規模、展開時の適合状況に左右されます。057.8ModelScopeAIツールボックスModelScopeは、アリババの達摩院が提供するオープンソースのモデルサービスプラットフォームです。AI開発者、研究者、企業チーム、教育機関を対象に、モデル探索から推論、トレーニング、デプロイ、アプリケーション開発までを支援するツールチェーンを提供します。プラットフォームには300以上のモデルが集約されており、コンピュータビジョン、自然言語処理、音声、マルチモーダル、科学計算などの分野をカバーしています。モデル共有、データセット管理、クラウドデプロイにも対応しています。ユーザーはタスク別にモデルを検索し、テスト、ファインチューニング、トレーニングを行ったうえで、Pythonライブラリと統一インターフェースを使ってプロジェクトに組み込めます。実際の利用にあたっては、モデルの依存関係、計算リソース、デプロイ環境に基づいて適合コストを評価する必要があります。058.6WhisperAIオーディオツールWhisperはOpenAIが開発した自動音声認識システムで、音声の文字起こし、音声翻訳、コンテンツ整理を目的としています。音声を入力すると対応する文字記録を取得でき、単語または文単位でタイムスタンプを確認できます。一部の英語以外の音声は、英語テキストへ直接翻訳することも可能です。多言語および複数のタスクを含む68万時間の教師ありデータで学習されており、モデルとコードが公開されています。開発者による統合、研究者による検証に適しているほか、インタビュー、ポッドキャスト、会議、講義、動画の整理にも利用できます。認識結果は、録音品質、アクセント、専門用語を考慮して、依然として人手で確認する必要があります。028.4Stable DiffusionAI画像制作Stable Diffusionは、Stability AIの画像生成モデルシリーズです。現在、公式の画像モデルページではStable Diffusion 3.5を主軸として、Large、Turbo、Mediumを提供しています。Largeはプロフェッショナル品質とプロンプトへの忠実な追従、Turboは少ないステップでの高速生成、Mediumは品質、カスタマイズ性、コンシューマー向けハードウェアでの実行のバランスを重視しています。モデルは、セルフホスティングライセンス、Stability AI API、クラウドパートナー、またはWebアプリケーションを通じて利用でき、消去、部分的な再描画、画像拡張、アップスケールに加え、スケッチ、構造、スタイル制御などの編集サービスも提供されています。以前公開されていたGitHubリポジトリのURLは現在404を返すため、利用や商用展開の際は公式の画像モデルページとライセンスページを確認してください。049

このタグが付いたすべてのツールを表示しています。