【生成AIニュース+】『Anima-2.9B』『LTX-2.5』『Muse Glimmer 30B』『Soniox TTS v2』『Dyna-2』『Grok Bot』『FLUX 3 Video』『Qwen-MM-Plugins』『MiniMax H3 LoRA Trainer / Realism People』『MiniMax-H3-Turbo』『MiniMax-H3-Looping-Sketch-Anime』『ComfyUI-H3-Motion-Context-MultiRef』他
『MiniMax-H3-LoRA-LineartAnime』
『KIRI-Maker』
『Bilawal Sidhu』
まいどです。
本日の生成AIニュース+テクノロジー情報です。
■Anima-2.9B
Anima-2.9Bは、アニメやイラスト生成に特化した約29億パラメータのText-to-Image画像生成モデルです。
NVIDIAの「Cosmos-Predict2-2B-Text2Image」を祖先に持つCircleStone Labsの「Anima 2B」をベースに、追加学習とTransformer層の拡張を行った派生モデルです。
現時点では完成版ではなく開発途中のプレビュー版です。
Preview v1では追加された新しい層を中心に学習しており、さらに約170万枚のアニメ、イラスト画像で追加学習されています。
■LTX-2.5
Lightricksが公開したオープンウェイトの動画・世界モデルです。
フィルム制作、ロボティクス、リアルタイムワークフロー向けに設計された基盤モデルで、画素忠実度の向上、カットをまたいでも一貫性を保つネイティブマルチショット生成、ドメイン横断でのファインチューンを想定した事前学習済み基盤が特徴です。
新たに導入されたDiffusion Fidelity Renderingにより、シネマ画面でも耐えうるフレーム単位の高い画素品質を実現しています。
Introducing LTX-2.5, the world model the world builds on.
— LTX.io (@ltx_io) August 11, 2026
One of the biggest upgrades yet to the model already powering film, robotics, and real-time workflows. Higher pixel fidelity, multishot scenes that hold together across cuts, and a pretrained foundation built to be… pic.twitter.com/bgnH6YMjQD
■Muse Glimmer 30B
Muse Glimmerは、Meta Superintelligence Labsが公開した、PC上で常時動かすAIエージェント向けの約300億パラメータのオープンウェイトモデルです。
一般的なチャットAIというより、ツールを何度も呼び出しながら長い手順を実行し、途中で失敗した場合には原因を判断して再試行するといった「自律エージェント」の処理をローカル環境で行うことを重視しています。
Metaのより大型なモデル「Muse Spark」から知識やエージェント能力を蒸留して作られています。
Introducing Muse Glimmer, an open-weight 30B-parameter model optimized for local, always-on agent workflows.
— AI at Meta (@AIatMeta) August 10, 2026
Muse Glimmer delivers strong performance on key agentic use cases and benchmarks compared with leading models in its size category, and is designed to run entirely on… pic.twitter.com/mI4z91GPnE
■Soniox TTS v2
Sonioxが発表した、強力なTTSモデルです。
優れた音声品質、オーディオタグによる表現力のあるコントロール、高い精度、高忠実度の音声クローニング、60以上の言語対応、自然な言語混在、低遅延ストリーミングを一つのモデルで実現しています。
新しいモデルアーキテクチャ、オーディオコーデック、高度に最適化された推論エンジンを一から構築し、生成時間1時間あたりわずか0.70ドルでフロンティア級のTTSを提供します。
リアルタイムモデルとして「tts-rt-v2」でグローバルに利用可能です。
Introducing Soniox TTS v2, our most powerful text-to-speech model yet.
— Soniox (@soniox_ai) August 11, 2026
Soniox TTS v2 brings extraordinary voice quality, expressive control through audio tags, exceptional precision, high-fidelity voice cloning, more than 60 languages, natural language mixing, and low-latency… pic.twitter.com/Q1LmsTmps8
■Dyna-2
Dyna-2は、Dyna Roboticsが公開した、100万時間以上の人間の一人称視点動画で事前学習したロボット向けWAMです。
人間の動画データを1,000時間から100万時間まで増やすほど性能が予測可能に向上し、さらに事前学習では一度も見ていないロボットのデータに対するゼロショット性能まで向上する「human-to-robot transfer scaling law」を確認したことが最大の成果です。
将来の映像を予測するWorld Modelingと大量の動画学習を組み合わせることで、人間の動作から得た物理的な知識をロボットへ転移させることを狙っており、新しい顧客環境へのゼロショット導入では87%の品質基準通過率を記録しています。
Today we are introducing Dyna-2, a world-action model pre-trained on one million hours of human video. At this scale, for the first time, we discovered several new scaling laws:
— Dyna Robotics (@DynaRobotics) August 10, 2026
• world-action models exhibit scaling law on human data across four orders of magnitude, from 1000… pic.twitter.com/wZamR0axzS
■Grok Bot
xAIが早期ベータ版として公開した、実際の仕事を任せることができるAIチームメイトです。
ボットは自身のコンピュータを持ち、ユーザーのツールやアプリにサインインして人間と同じように操作し、タスクを完了させて結果を返します。
ベンダー交渉、オンラインストアのサポート管理、CRMの更新など、具体的な業務を24時間体制で実行可能です。
現在はSuperGrok Heavy、Cursor Ultra、Cursor Teams Premiumの加入者向けにデスクトップとiOSで利用できます。
Introducing Grok Bot, now in early beta.
— Grok Bot (@bot) August 11, 2026
Bots are AI teammates that do real work for you. They sign in to your tools, use them just like you do, and come back with finished work. pic.twitter.com/uyfA97yo98
■FLUX 3 Video
Black Forest Labsが公開した動画生成モデルで、
Text-to-Video Arenaで世界2位にランクインしています。
テキストや画像から最大20秒のHD/FHD動画を生成でき、ネイティブオーディオ(台詞・効果音・環境音)も同時に生成します。
マルチショット対応や多言語リップシンクも特徴で、今後は4K対応、動画編集、複数画像・動画をリファレンス入力として使える機能が予定されています。
FLUX 3 Video is #2 in the world.
— Black Forest Labs (@bfl_ai) August 11, 2026
To celebrate, FLUX 3 Video is free to use in our playground until Sunday 16th, 11:59pm PT (link in the thread).
This is just the beginning of what’s coming. Up next: 4K, video editing, and multiple images & videos as reference input. https://t.co/q2yZHOmCBh pic.twitter.com/d2ulDdMvFN
https://auth.bfl.ai/?redirect_uri=https%3A%2F%2Fdashboard.bfl.ai%2Fplayground%2F
■Qwen-MM-Plugins
Qwen-MM-Pluginsは、AlibabaのQwenチームが公開したオープンソースのマルチモーダルプラグインセットです。
任意のエージェントハーネスをマルチモーダルネイティブに拡張し、画像・動画・ドキュメントの読み取り、動画編集、3D/CAD操作、長時間動画の記憶管理などを可能にします。
各能力は独立したSkillとオプションのMCPサーバーとして提供され、Claude CodeやCodex、Qwen Codeなど複数のエージェントフレームワークに対応しています。
インストールは案内スクリプトで簡単に行え、Apache-2.0ライセンスで公開されています。
👀 Seeing is just the beginning.
— Qwen (@Alibaba_Qwen) August 10, 2026
With Qwen-MM-Plugins, turn your favorite agent harness multimodal-native — read images, videos & documents, edit videos, work with 3D/CAD, and more.
From multimodal models → multimodal agents. 🚀
Watch it in action:https://t.co/C2jQObXryM pic.twitter.com/X6xQ3Hl4ln
■MiniMax H3 LoRA Trainer / Realism People
falが公開した、MiniMax H3を自分の動画データで追加学習できるLoRAトレーナーです。
人物、キャラクター、画風、動きなどを少量の動画から学習させられ、Text-to-Video、Image-to-Video、最初と最後のフレーム指定、Reference-to-Videoに対応しています。
映像だけでなくH3の音声生成も同時に学習できます。
デモとして公開された「Realism People」は、176本の実写人物クリップで学習され、肌の質感、目や表情、照明、人物の動きをより実写らしく寄せるLoRAです。
LoRA trainer for MiniMax H3 is now available on fal.
— fal (@fal) August 10, 2026
to show what it can do, we trained Realism People, an open-source LoRA
that pushes H3 toward raw, photorealistic humans. skin, eyes, motion.
More LoRA coming soon ! pic.twitter.com/AwETlpSy6S
■MiniMax-H3-Turbo
MiniMax-H3-Turboは、MiniMax H3を少ない生成ステップで高速に動かすための蒸留LoRAです。
通常のH3では50ステップ程度で生成する構成に対して、LightX2V版では4ステップまたは8ステップまで削減しており、品質をできるだけ維持しながら生成時間を大幅に短縮することを狙っています。
Text-to-VideoやFirst-Last-Frame-to-Videoに対応し、最新版では544pの4ステップ、8ステップ版に加えて、1344×768の768pを4ステップで生成するモデルも公開されています。
ベースモデルそのものを置き換えるのではなく、MiniMax-H3に追加して使う高速化用LoRAです。
■MiniMax-H3-Looping-Sketch-Anime
MiniMax-H3-Looping-Sketch-Animeは、MiniMax H3で手描き風のアニメスケッチ動画や自然に繰り返すループ動画を生成するためのLoRAです。
ラフで質感のある線、フラットな色使い、白いアウトラインなどを持つ2Dアニメ調の表現に特化しており、通常のMiniMax H3に追加して使います。
推奨LoRA強度は0.75〜1.25程度で、Turbo LoRAと併用する場合はさらに強めることも想定されています。
説明では、アニメ指定を外すことで西洋的なスケッチ風にも寄せられます。
■ComfyUI-H3-Motion-Context-MultiRef
ComfyUI-H3-Motion-Context-MultiRefは、MiniMax H3で長い動画を自然につなげて生成するためのComfyUIカスタムノードです。
前の動画の最後の映像と音声をコンテキストとして次の生成へ渡すことで、単純に動画を連結するよりも動きや音声の連続性を保ちやすくしています。
さらに複数の参照画像を使うRef2VA/MultiRef、任意の位置に画像を置くCustom Keyframes、既存MP4動画からの続き生成にも対応しています。
最新版では既存動画の末尾39フレームなどをMiniMax H3の映像音声Latentへ保持したまま続きを生成し、境界部分をクロスフェードすることで継ぎ目を目立ちにくくする仕組みも追加されています。
■MiniMax-H3-LoRA-LineartAnime
MiniMax-H3-LoRA-LineartAnimeは、ModelScopeのDiffSynth-Studioが公開した、MiniMax H3で線画動画をアニメ調の完成映像へ変換するための軽量LoRAです。
線だけで構成されたラフな動画やラインアートを入力として、色や質感を加えたアニメ映像へ仕上げる用途を想定しています。
MiniMax H3本体を置き換えるモデルではなく、H3に追加して特定の表現を強化するLoRAです。
DiffSynth-Studio側ではMiniMax H3の推論やLoRA学習にも対応しているため、同様の動画変換LoRAを自分のデータで作成することもできます。
🚀 DiffSynth-Studio has open-sourced a LoRA model for Minimax-H3 that turns line art videos into stunning anime. It’s lightweight, ready to use, and built for creators.
— ModelScope (@ModelScope2022) August 10, 2026
🤖https://t.co/vzVz7nfDf0
🎨 Want to train more models like this? Check out the DiffSynth-Studio GitHub… pic.twitter.com/uWIxHSSLxP
■KIRI-Maker
KIRI Engineが公開した、3D Gaussian Splatting向けのオープンソースツールです。
ブラウザ上で3DGSモデルを読み込み、パーティクルエフェクトの適用、シネマティックなカメラパスのアニメーション、ジェスチャー操作、動画エクスポートが可能です。
KIRI Engineのスキャンだけでなく、PolycamやLumaの3DGS共有リンクにも対応しています。
マーケティング担当者がコーディング経験なしに「vibe coding」で開発した点が特徴で、静的なスキャンを遊び・編集・動画化できるツールとして提供されています。
We built KIRI-Maker, an open source project for 3D Gaussian Splatting.
— KIRI Engine - 3D Scanner App (@KIRI_Engine_App) August 11, 2026
The interesting part? 🤩 It was built by one of our marketing team members with no coding background, using vibe coding to turn an idea into a working tool.
Since it’s open source, we didn’t want to limit it… pic.twitter.com/Hr2knzBW5c
■Bilawal Sidhu
撮影した動画を、撮影した正確な場所に永続的な3Dホログラムとして配置する技術のデモンストレーションです。
iPhoneで撮影した母鹿と子鹿の映像を、実際に撮影した場所に浮かぶジオアンカー付きの3Dホログラムに変換しています。
これまでは写真で同様の空間メモリを実現していましたが、任意の動画でも可能になったことを示しています。
空間コンピューティングやVPSを活用した、現実空間に紐づく永続的な3D体験の一例です。
What if every video you ever shot could turn into a permanent 3D hologram in the exact place it happened?
— Bilawal Sidhu (@bilawalsidhu) August 11, 2026
I did it with photos first. Now I can do it with any video.
Here’s a mama deer and her baby deer, filmed with my iphone a few days ago -- now floating as geo anchored… pic.twitter.com/Vds1JcwEyX
本日は以上となります。
過去の生成AIニュースは買い切りマガジンの「【生成AIニュース】アーカイブ」で全て見ることができます。
SDなどで使えるプロンプト集です。マガジンご購入者にももれなく付いてきます。
マガジンご購入者専用の特典「生成AIツール辞典」です。
それでは、また。



コメント