混元 Hy4 preview 8个项目实测,我想买腾讯股票了!
腾讯发布混元 Hy4 preview 模型,总参数770B,激活49B,上下文1M,强化了多步骤Agent、代码开发和生产力任务能力。实测显示前端审美大幅提升,长程任务稳定,能生成动效画布、在线鼓机、游戏等,并主动询问和遵守版权。模型已内置到Workbuddy,免费试用两周。
腾讯发布混元 Hy4 preview 模型,总参数770B,激活49B,上下文1M,强化了多步骤Agent、代码开发和生产力任务能力。实测显示前端审美大幅提升,长程任务稳定,能生成动效画布、在线鼓机、游戏等,并主动询问和遵守版权。模型已内置到Workbuddy,免费试用两周。
腾讯混元4Preview模型发布,在Arena的WebDEV评分中排名第五,与刚发布的GLM-5.3Flash相近。该模型总参数770B,激活参数49B。

Cohere 发布文档解析模型 Parse 5,支持文本、表格、表单和图像识别,并提供边界框定位,便于 RAG 和自动化处理。定价每 1000 页 1.50 美元,比前沿模型和主流云服务便宜 95%,比 Mistral 便宜 63%。模型未开源,可通过 API 或 HuggingFace 体验。
新加坡 AI 实验室 Agnes AI 发布了 Agnes 2.5 Pro Beta,在 Artificial Analysis 智能指数上得分 49,较 Alpha 版提升 9 分,主要得益于智能体能力的显著增强,但输出 token 消耗约为前代的两倍。该模型在智能体指数上从 25 跃升至 44,接近 Gemini 3.7 Flash,同时在前沿推理评测中也有小幅提升。模型支持 1M 上下文,定价为每百万输入/输出/缓存命中 token 0.10/0.30/0.01 美元,现可通过其 API 使用。

fal 团队优化了 MiniMax-H3 Max 模型,提升了实际性能,并协同设计推理系统以实现超实时速度。这结合了前沿模型研究与深度推理优化能力,展示了第三方后训练模型的潜力。
Gemini Omni Flash 1.1 发布,支持 360p 草稿、4K 上采样、10 秒视频上下文扩展及视频引用。

Google 发布 Gemini 3.5 Transcribe,支持 85 种以上语言,实时转写延迟低于一秒,支持自定义专业词汇和混合语言输入,将提升实时翻译和转写产品的体验。
谷歌发布Gemini 3.5 Transcribe,提供实时和非实时两个版本,支持通过语音调用工具、识别说话人、时间戳及去除语气词。已在AI Studio中可用,API Key可免费调用。
Qwen3.8-Flash 已在 Qwen Cloud 上线,定价为输入 $0.15/百万 tokens,输出 $0.47/百万 tokens,缓存命中仅 $0.016/百万 tokens。
作者揭秘 GLM-5.3-Flash 即 X 上热门的“Ox-Alpha”,实测 6-7 个场景,包括将整部电影剪辑成 3 分钟解说版,并分享提示词、制作思路和工具。最令人震惊的是,该模型使用国产卡部署,推测需数十万张。
智谱发布GLM-5.3-Flash,320B总参数,激活18B,为GLM-5系列首个原生多模态模型。在AA综合智能指数上得分57,与Opus 4.8持平,但价格仅为后者的1/40。该模型采用稀疏注意力与线性注意力混合架构,上线后调用量激增,成为OpenRouter周榜第一。
Fastino发布了仅0.3B参数的信息抽取模型GLiNER2.5,相比2.0版本,支持长文本自动分段处理、无长度限制的长句子抽取、避免自相矛盾的判断,并能在抽取实体的同时进行情感标签分类。模型已开源。

ox 明显比 flash 要强,也比 August 要强。期待这周出正式版,期待不要太贵。
Ox Alpha 是五天前在 OpenRouter 上悄然上线的前沿模型,现已引发全网广泛讨论。据称其每日处理量已达 8 万亿 tokens。社区成员在 Discord 上分享了看法。
阿里万相3.0已在OpenRouter上线,支持从文本、图像或参考生成2-30秒视频,分辨率可选480p、720p、1080p。定价为每秒$0.05/$0.10/$0.20,限时所有分辨率15%折扣。
Ox Alpha 今日预计处理近6万亿token,现可通过ori在编码代理中使用,命令为:$ ori [your favorite harness] --model stealth/ox-alpha。

Claude又解决超级数学难题了,这一个月这是第3次了吧?
最近 Flash 级别的模型能力都上来了,又一个全新模型 August 来了,小型、快速、高性能。Ox 牛来在海外已经火到暴量,现在全网的资源紧张,在官方公布谜底之前,应该都是这样的状态了。Cola 首发,限时免费 2 天,欢迎来玩~

商汤开源AI绘画模型SenseNova-U1.5-8B-MoT,但汉字生成能力较弱,其他方面尚可。模型和在线体验已发布。

用户给 Ox Alpha 一张图片,要求用 WebGL 还原网页。模型成功生成 3D 玻璃材质和透视效果,文字位置和排版细节与原图几乎一致,仅字体略有差异。

我对神秘模型 Ox Alpha 并不像其他人那样印象深刻。在早期实验中,它表现尚可,但在开源权重中并未达到前沿水平。以下是我在 neogothic city twigl shader 测试中的结果,与引用的推文中的 Kimi K3 对比。仍在测试中。
Ox Alpha是GLM Air系列的新模型,定位为Flash级别,能力尚可但不算逆天,目前炒作有些过度。
研究团队发布VA-Judger,首个能同时评估视频画面和声音的裁判模型。它从文字匹配度、声画同步率、画面质量、声音质量和内容完整性五个维度打分,以更符合人类感知的方式指导生成模型改进。团队收集了上万组人类对比数据,并公开测试集,代码和模型完全开源。
Thinking Machines 公司将其开源 MoE 推理模型 Inkling 和 Inkling Small 直接部署在 OpenRouter 平台上,供智能体框架(如 Claude Code、Codex、Hermes Agent)免费调用。模型支持文本、图像和音频输入,上下文窗口达 1M。此举旨在降低智能体开发门槛,推动开源模型在智能体生态中的应用。
全网竞猜 OX Alpha是哪家的模型啊。 有不少人做了分析,智谱概率更大。 但叫这个名字,大家又会自然想到雷总的小米 MiMo,哈哈哈。 猜对猜错都行,反正都是国模。 据不少朋友的私人评测集显示,很接近一流前沿模型,牛逼啊!
DeepSeek V4 Flash Vision Exp 已在 OpenRouter 上线,支持图像输入,定价与 V4 Flash 相同,文本智能体基准与 V4 Flash 0731 持平,并在 Agents' Last Exam 和 ZeroBench 上超越 Opus-4.8。

DeepSeek 推出多模态模型 V4 Flash Vision EXP,据称多模态 Agent 能力接近 Opus 4.8,纯文本能力与 V4 Flash 相同,价格保持一致。

DeepSeek 发布实验性多模态模型 V4-Flash-Vision-Exp,文本能力与 V4-Flash 相当,多模态智能体基准大幅提升,接近 Opus-4.8。同时发布 DeepSeek Harness 0.1.1 以支持新模型。

Ox 可能是整个 8 月最惊喜的大模型了,强烈推荐试用,免费 7 天。目前已在 Cola、Openrouter、Hermes、Opencode 等平台上线。
阿里巴巴发布第三代图像生成模型 Qwen-Image-3.0 系列,其中 Pro 版在 Artificial Analysis 图像编辑排行榜位列第六,文生图排行榜第九,较上代大幅提升。该系列支持 4.5k token 提示词、精确渲染小至 10 像素的文字及 12 种语言,并通过阿里云 Model Studio 提供 API,定价每张 0.03 至 0.075 美元。