lithovas.

AI日报:京东开源视频实时编辑模型;Qwen-Image-3.0上线;腾讯混元发布Hy ASR 3.0 preview

· 97AI Team 编辑整理

京东开源 JoyAI-Video-Edit,实现 30 帧实时视频编辑

京东开源 JoyAI-Video-Edit,实现 30 帧实时视频编辑

京东正式开源自研的流式视频编辑模型 JoyAI-Video-Edit,在 720P 分辨率下实现了每秒 30 帧的实时推理速度。该模型打破了传统视频编辑需“先生成后修改”的限制,支持用户在视频播放的同时进行场景替换、物体修改及风格调整。此外,该模型在 OpenVE-Bench 权威评测中表现卓越,在全局风格与局部编辑任务上均处于行业领先水平。除了创意视频创作,JoyAI-Video-Edit 还为具身智能提供了新路径,可通过编辑现有视频高效合成机器人训练所需的动作与场景数据,显著降低真机采集成本。

阿里通义千问推出 Qwen-Image-3.0,文生图榜单全国第一

阿里通义千问推出 Qwen-Image-3.0,文生图榜单全国第一

阿里巴巴正式上线千问图像生成模型 Qwen-Image-3.0,目前已在 Arena 文生图榜单中位列国内第一。该模型支持最高 4.5k token 的超长文本指令输入,具备极强的复杂版面理解能力,能够精准渲染 10px 小字及复杂 LaTeX 公式。模型覆盖了 100 多种艺术风格与 12 国语言原生渲染,且将生成与编辑功能合并至同一架构中,大幅提升了商业工作流的效率。目前该模型已全量开放 API,标准版与专业版定价极具竞争力,旨在降低专业级 AI 图像创作的门槛。

97AI 视角97AI 聊天分类聚合 Claude/GPT/Gemini 等多家旗舰,一个 API 按次调用、无需分别开户

腾讯混元发布 Hy ASR 3.0 preview,语音识别实现语境理解

腾讯混元发布 Hy ASR 3.0 preview,语音识别实现语境理解

腾讯混元发布的新一代语音识别模型 Hy ASR 3.0 preview,将语音识别技术从简单的“逐字转写”提升至“语义理解”层面。该模型基于 Hy3 大语言模型构建,支持粤语、吴语等十大方言片区,多语种词错误率(WER)控制在 3% 左右,在长音频与专业场景中表现出色。通过 MoE 架构与千万小时级无监督数据训练,模型能结合上下文逻辑自动纠错同音词。目前该功能已在腾讯“元宝”AI 助手上线,并向开发者开放 API,显著提升了智能客服与语音搜索的交互自然度。

字节跳动发布 SeedRealtime,音视频全双工大模型登陆豆包

字节跳动发布 SeedRealtime,音视频全双工大模型登陆豆包

字节 Seed 团队推出的 SeedRealtime 是一款统一架构的全双工大模型,目前已在豆包 App 全量上线。该模型原生集成了音频、视频与文本的感知与表达能力,打破了以往“听-转-想-说”的级联方案限制,大幅降低了实时交互中的语音节奏问题。SeedRealtime 在对话中展现出极佳的“分寸感”,能实现像真人一样的自然停顿与呼吸间隔,从而提供更加流畅、无卡顿的实时交流体验,标志着全模态智能助手技术迈向规模化落地。

马斯克预告 Grok 4.6,SpaceX 历史数据助力模型升级

马斯克在 SpaceX 首次财报电话会上透露,Grok 4.6 模型将于下周发布,随后 Grok 4.7 也将跟进。此次迭代的一个关键战略是深度整合 SpaceX 的全部历史数据进行模型训练。马斯克强调,Grok 的后续演进将不再仅依赖公开互联网语料,而是通过注入大量私有专业领域数据,以提升模型处理复杂逻辑的能力。这一举措标志着 Grok 试图通过行业专属数据构建护城河,增强其在专业任务处理上的竞争力。

影石 AI 硬件集成千问大模型,语音助手 Kira 落地 Go Ultra

影石 AI 硬件集成千问大模型,语音助手 Kira 落地 Go Ultra

影石 Insta360 正全面深化硬件产品的 AI 融合,其 Go Ultra 系列口袋相机已率先装载由阿里千问多模态模型驱动的 AI 语音助手 Kira。该系统通过深度结合自研技术,不仅具备高精度的声纹识别能力,还支持复杂的云端问答与多语言处理。为了提升用户体验,影石针对全球不同地区采用了针对性的大模型优化,确保了跨语言翻译和播报的准确性,使拍摄交互变得更加智能化与无缝化。

Mistral 推出的 Shieldstral:单卡 16GB 运行的 SOTA 审核模型

Mistral 推出的 Shieldstral:单卡 16GB 运行的 SOTA 审核模型

Mistral AI 发布了 Shieldstral 内容审核模型,这是一个拥有 30 亿参数的开放权重模型,可在单张 16GB 显卡上高效运行。其核心创新在于将审核政策以“输入问答”的形式嵌入,允许开发者动态调整安全标准,而无需重复训练权重。模型支持 12 种语言,能够覆盖提示词分类、毒性检测及回答审核等任务,并在多模态审核领域达到了当前开源界的最先进水平(SOTA)。该模型的发布,为中小型团队提供了低成本、高灵活性的内容安全解决方案。

机器人独角兽宇树科技冲击科创板,拟募资超 40 亿元

国内人形机器人领军企业宇树科技于 8 月 5 日正式开启科创板 IPO 初步询价,计划公开发行 4044.64 万股,拟募资总额达 42.02 亿元。市场普遍预计其发行价格约为 104 元/股,有望成为“A 股人形机器人第一股”。此次资本化进程的提速,将为宇树科技在机器人本体研发、具身智能模型突破及大规模产能建设方面提供充足资金保障,标志着我国人形机器人产业链正从技术储备阶段加速向商业化与规模化生产阶段过渡。

在 97AI 试用日报里的模型

174 个 AI 模型一站接入,支持 USDC、支付宝、信用卡。生成失败不计费。

查看全部模型价格 →