混元 Hy4 preview 8个项目实测,我想买腾讯股票了!
腾讯发布混元 Hy4 preview 模型,总参数770B,激活49B,上下文1M,强化了多步骤Agent、代码开发和生产力任务能力。实测显示前端审美大幅提升,长程任务稳定,能生成动效画布、在线鼓机、游戏等,并主动询问和遵守版权。模型已内置到Workbuddy,免费试用两周。
腾讯发布混元 Hy4 preview 模型,总参数770B,激活49B,上下文1M,强化了多步骤Agent、代码开发和生产力任务能力。实测显示前端审美大幅提升,长程任务稳定,能生成动效画布、在线鼓机、游戏等,并主动询问和遵守版权。模型已内置到Workbuddy,免费试用两周。
腾讯混元4Preview模型发布,在Arena的WebDEV评分中排名第五,与刚发布的GLM-5.3Flash相近。该模型总参数770B,激活参数49B。

Cohere 发布文档解析模型 Parse 5,支持文本、表格、表单和图像识别,并提供边界框定位,便于 RAG 和自动化处理。定价每 1000 页 1.50 美元,比前沿模型和主流云服务便宜 95%,比 Mistral 便宜 63%。模型未开源,可通过 API 或 HuggingFace 体验。
fal 团队优化了 MiniMax-H3 Max 模型,提升了实际性能,并协同设计推理系统以实现超实时速度。这结合了前沿模型研究与深度推理优化能力,展示了第三方后训练模型的潜力。
Google 发布 Gemini 3.5 Transcribe,支持 85 种以上语言,实时转写延迟低于一秒,支持自定义专业词汇和混合语言输入,将提升实时翻译和转写产品的体验。
谷歌发布Gemini 3.5 Transcribe,提供实时和非实时两个版本,支持通过语音调用工具、识别说话人、时间戳及去除语气词。已在AI Studio中可用,API Key可免费调用。
Qwen3.8-Flash 已在 Qwen Cloud 上线,定价为输入 $0.15/百万 tokens,输出 $0.47/百万 tokens,缓存命中仅 $0.016/百万 tokens。
作者揭秘 GLM-5.3-Flash 即 X 上热门的“Ox-Alpha”,实测 6-7 个场景,包括将整部电影剪辑成 3 分钟解说版,并分享提示词、制作思路和工具。最令人震惊的是,该模型使用国产卡部署,推测需数十万张。
智谱发布GLM-5.3-Flash,320B总参数,激活18B,为GLM-5系列首个原生多模态模型。在AA综合智能指数上得分57,与Opus 4.8持平,但价格仅为后者的1/40。该模型采用稀疏注意力与线性注意力混合架构,上线后调用量激增,成为OpenRouter周榜第一。
Fastino发布了仅0.3B参数的信息抽取模型GLiNER2.5,相比2.0版本,支持长文本自动分段处理、无长度限制的长句子抽取、避免自相矛盾的判断,并能在抽取实体的同时进行情感标签分类。模型已开源。

ox 明显比 flash 要强,也比 August 要强。期待这周出正式版,期待不要太贵。
Claude又解决超级数学难题了,这一个月这是第3次了吧?
最近 Flash 级别的模型能力都上来了,又一个全新模型 August 来了,小型、快速、高性能。Ox 牛来在海外已经火到暴量,现在全网的资源紧张,在官方公布谜底之前,应该都是这样的状态了。Cola 首发,限时免费 2 天,欢迎来玩~

商汤开源AI绘画模型SenseNova-U1.5-8B-MoT,但汉字生成能力较弱,其他方面尚可。模型和在线体验已发布。

用户给 Ox Alpha 一张图片,要求用 WebGL 还原网页。模型成功生成 3D 玻璃材质和透视效果,文字位置和排版细节与原图几乎一致,仅字体略有差异。

Ox Alpha是GLM Air系列的新模型,定位为Flash级别,能力尚可但不算逆天,目前炒作有些过度。
研究团队发布VA-Judger,首个能同时评估视频画面和声音的裁判模型。它从文字匹配度、声画同步率、画面质量、声音质量和内容完整性五个维度打分,以更符合人类感知的方式指导生成模型改进。团队收集了上万组人类对比数据,并公开测试集,代码和模型完全开源。
全网竞猜 OX Alpha是哪家的模型啊。 有不少人做了分析,智谱概率更大。 但叫这个名字,大家又会自然想到雷总的小米 MiMo,哈哈哈。 猜对猜错都行,反正都是国模。 据不少朋友的私人评测集显示,很接近一流前沿模型,牛逼啊!
DeepSeek 推出多模态模型 V4 Flash Vision EXP,据称多模态 Agent 能力接近 Opus 4.8,纯文本能力与 V4 Flash 相同,价格保持一致。

DeepSeek 发布实验性多模态模型 V4-Flash-Vision-Exp,文本能力与 V4-Flash 相当,多模态智能体基准大幅提升,接近 Opus-4.8。同时发布 DeepSeek Harness 0.1.1 以支持新模型。

Ox 可能是整个 8 月最惊喜的大模型了,强烈推荐试用,免费 7 天。目前已在 Cola、Openrouter、Hermes、Opencode 等平台上线。
Generalist 发布机器人模型 GEN-1.5,通过观看 3-12 秒的动作演示即可学会新任务,平均成功率约 59%,经 5 分钟快速适应后可达 83%。该模型支持动作串联、从人手或电脑动画学习,并能灵活使用替代工具,有望大幅降低机器人编程门槛。
感谢 Unsloth 的杰出工作,这对社区来说是个好消息!Qwen3.8-27B 比以往更小更锐利,让我们试试吧!
智谱联合创始人唐杰透露,GLM-5.3 未更换基座,基于 GLM-5.2(743B MoE,激活 40B)通过一个月长周期强化学习,编码能力提升 50%。他强调总参数量决定知识量,激活参数与有效深度决定推理深度,并指出后训练仍有巨大潜力,模型扩展不止堆参数一条路。