🔥 HN 热议

Qwen3.8-Omni-Flash发布:一个模型同时理解文字、图片、声音和视频

约2分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
全模态(quán mó tài)

同时处理文字、图片、声音和视频等信息。

上下文窗口(shàng xià wén chuāng kǒu)

一次请求中,模型可以参考的信息范围。

Qwen3.8-Omni-Flash(Qwen 3.8 Omni Flash)

阿里巴巴 Qwen 团队发布的多种输入AI模型。

发生了什么

阿里巴巴的 Qwen 团队发布了 Qwen3.8-Omni-Flash。它可以接收文字、图片、音频和视频。Qwen 官方资料把它用于音视频理解、会议摘要和字幕生成。资料还列出 1M 上下文窗口、工具调用和网页搜索等能力。模型的主要任务,是理解这些输入后生成文字。Qwen 官方文档

这条消息也登上了 Hacker News。相关帖子有327个积分和126条评论。这个数字说明技术社区关注它。它不等于模型已经被证明可靠。Hacker News 帖子

背景:什么是全模态

视频不只有画面。它还有说话声、背景声音、画面文字和时间顺序。全模态模型,就是尝试把这些不同信息放进同一套理解流程里。这样做的价值,不只是能看图,而是能把图像发生的事和声音说的话联系起来。

在很多长视频工作流中,内容需要分段处理。Qwen3.8-Omni-Flash强调较大的上下文窗口。1M不是永久记忆,也不是模型一定能正确理解一百万个单位。它表示一次请求可以放入很长的信息。能放进去,不代表每一处都能看得准确。

为什么重要

如果一场会议里,决定出现在前半段,细节出现在后半段,完整上下文有机会帮助模型写出更连贯的摘要。字幕也可能受益于前后语句的联系。接入工具调用后,模型还可以让外部程序执行指定动作。网页搜索则能提供外部资料。这些功能组合起来,指向一种先看懂音视频,再查询或处理的工作方式。但这只是应用可能,不是每次都能完成的保证。

已确认的信息

Qwen云文档列出 Chat Completions 和 Responses 两种调用路径,并明确列出工具调用和网页搜索。Qwen发布资料还称,在30项评测中,平均成绩比Qwen3.5-Omni-Plus高出超过26%。这是提供方公布的测试结果,不是独立机构复测。Qwen发布资料

Hacker News的327分和126条评论只说明帖子受到关注。不能用它来证明上述性能数据,也不能把它当成模型可靠性的测试。

还不知道什么

目前还不能只靠这些资料判断,模型在长视频、杂音、口音或多语言场景中会错在哪里。真实价格、响应速度和错误率,也要看具体接口和用法。尤其要确认它能否稳定地找到关键片段,而不是只给出听起来顺口的总结。

接下来关注

接下来应看第三方评测、实际用户案例和公开的错误分析。还要看长音视频任务的费用,以及工具调用是否容易被人检查。更稳妥的结论是:Qwen3.8-Omni-Flash让多种输入放进一次AI工作流成为新的选择,但它还不是“什么都能准确理解”的证明。

💬 Qwen 3.8 Omni Flash:能力令人期待,但本地运行代价高

HN评论对它的音频、视频能力和低价格很感兴趣,但实际速度与稳定性的体验大多来自相关的 Qwen 3.8 Flash Next/Max,不一定能直接代表 Omni Flash。

  • 一位评论者把文章中的比较概括为:Omni Flash 的音频和视频能力接近 Gemini 3.8 Flash,音频能力更强。这个信息是评论者转述的,未经过独立验证。
  • 一位评论者给出的价格比较是:Qwen 3.8 每百万输入/输出 token 为 0.15/0.47 美元,Gemini 为 1.50/9.00 美元。这些是评论者提供的、此处未核实的数字。
  • 反对意见是,每 token 价格不等于每项任务的成本;完成同一任务所需的 token 数和效率可能让结论发生变化。
  • 关于相关的 Flash Next,用户自述称 125B 版本能力很强,但约需 128GB RAM。有估算认为,要超过 40 token/s 需要约 3,000 美元的配置,RTX 4090 配置约为 30 token/s,而 27B 更容易运行。
  • 一些用户自述遇到奇怪的推理文字、虚构的上下文或过长的推理,某些量化或服务方式可能会降低质量;有人称 NVFP4 配置改善了问题,但这还不是已确认的普遍故障。
  • 开放权重的发布速度也有分歧:有人认为正在变慢,另有人指出 Qwen 3.8 Max 和 Flash Next 已发布权重。评论没有形成共识。

这是评论数为137时的成熟版(修订2)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。

🔥 HN 热议

Qwen3.8-Omni-Flash:能看图、听声音的新AI

📰 完整报道: Qwen3.8-Omni-Flash发布:一个模型同时理解文字、图片、声音和视频

一种能同时处理文字、图片、声音和视频的新AI出现了。

约1分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
上下文窗口(shàng xià wén chuāng kǒu)

一次能放进AI视野的信息量。

工具调用(gōng jù diào yòng)

让AI请求其他程序完成工作的功能。

Hacker News(Hacker News)

讨论技术新闻的网站。

💡 一句话总结

  • 它能接收文字、图片、音频和视频。
  • 它能帮忙总结会议和制作字幕。
  • Hacker News的热度代表关注,不代表正确。

它带来了什么?

Qwen3.8-Omni-Flash(阿里巴巴 Qwen 团队的AI)发布了。它能接收文字、图片、音频和视频。官方资料说,它可用于分析音视频、总结会议和生成字幕。Qwen官方文档

它还有1M上下文窗口。上下文窗口可以理解为,一次能放进AI视野的信息量。信息放得更多,AI就有机会联系视频前后的内容。但容量大,不代表答案一定正确。

它支持工具调用和网页搜索。工具调用可以让AI请求其他程序帮忙。网页搜索可以让它查找网上资料。接入这些功能后,它不只是在回答问题,也能参与更长的工作流程。

Qwen方面称,它在30项评测中的平均成绩,比上一代Qwen3.5-Omni-Plus高出超过26%。这是发布方自己的数据。还需要独立测试来验证。Qwen发布资料

Hacker News的相关帖子有327个积分和126条评论。这说明它受到关注。它不能证明模型一定可靠。接下来要看长视频、杂音和不同语言下的表现,也要看真实价格和速度。

💬 Qwen 3.8 Omni Flash:很有希望,但运行起来不轻松

评论者看好它的能力和价格。不过,关于速度和故障的实际体验,主要来自相关的 Flash Next/Max,并不一定适用于 Omni Flash。

  • 有人说,文章显示 Omni Flash 的音频和视频能力接近 Gemini 3.8 Flash,音频可能更强。但评论中没有独立验证。
  • 评论者给出的价格是:每百万 token,Qwen 输入0.15美元、输出0.47美元;Gemini为1.50美元、9.00美元。可是,一个任务如果使用更多 token,最终花费可能不同。
  • 相关的125B版本据用户自述需要约128GB内存。超过40 token/s的配置估计约需3,000美元,RTX 4090配置约30 token/s;27B版本更容易运行。
  • 一些用户遇到奇怪的推理、虚构的上下文或很长的推理。运行方式和量化可能有影响;有人说NVFP4有所改善,但不能确定所有人都会遇到这个问题。
  • 有人认为开放权重发布变慢,也有人指出Max和Flash Next已经发布,因此评论没有一致结论。

这是评论数为137时的成熟版(修订2)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。

🔥 HN 热议

Qwen3.8-Omni-Flash能看很多东西

📰 完整报道: Qwen3.8-Omni-Flash发布:一个模型同时理解文字、图片、声音和视频

这个AI能一起看文字、图片、声音和视频。

约1分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
Qwen3.8-Omni-Flash(Qwen 3.8 Omni Flash)

阿里巴巴 Qwen 团队做的AI。

Hacker News(Hacker News)

人们讨论技术新闻的网站。

它是什么?

Qwen3.8-Omni-Flash(阿里巴巴 Qwen 团队做的AI)来了。 它能看文字、图片、声音和视频。 它会用文字回答问题。

它能做什么?

它能帮忙整理会议。 它能帮忙做字幕。 它也能叫电脑工具帮忙。

大家为什么谈?

这条消息在Hacker News(技术新闻网站)上很受关注。 帖子有327分和126条评论。 这表示很多人注意到它。 这不表示它每次都正确。

还要记得

AI也会答错。 大人要检查答案。

💬 Qwen 3.8 Omni Flash:可能很聪明,但很大,也有点调皮

大家觉得它有潜力,但这些体验并不是在完全相同的条件下得到的。

  • 一位评论者说,文章里的结果让 Omni Flash 的声音和画面能力看起来接近 Gemini 3.8 Flash,声音可能更强。不过还没有独立确认。
  • 评论者提供的价格是:每百万 token,Qwen 输入0.15美元、输出0.47美元;Gemini是1.50美元、9.00美元。但一个任务如果读很多 token,便宜不一定代表总价便宜。
  • 相关的大型125B版本像一个需要大桌子的模型:据用户说约需128GB内存。超过40 token/s的机器估计约3,000美元,RTX 4090约30 token/s,小型27B更容易运行。
  • 一些人看到奇怪的思考文字、自己编出的上下文或很长的等待,可能和运行方法有关;另一些人仍觉得它好用。大家也没有决定开放权重是否变慢,有人指出Max和Flash Next已经公开。

这是评论数为137时的成熟版(修订2)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。

来源