QwenMix-3.7:合并 Qwen3.8 和 3.6 的尝试
作者看到社区讨论 Qwen3.8 和 3.6 结构相似,于是尝试用 Qwen3.8-27B-UD-Q6_K_XL.gguf 合并两者的 HF 权重,结果可行,但仅通过冒烟测试。脚本和想法已放在模型仓库的 replicate/ 目录下。
作者看到社区讨论 Qwen3.8 和 3.6 结构相似,于是尝试用 Qwen3.8-27B-UD-Q6_K_XL.gguf 合并两者的 HF 权重,结果可行,但仅通过冒烟测试。脚本和想法已放在模型仓库的 replicate/ 目录下。
llama.cpp 的 PR #27402 通过 AVX2 优化,大幅提升 IQ 量化模型在 CPU 上大批量(如 512)提示处理的速度。在 EPYC 9654 上测试,PPL 不变,速度提升显著。
TinySearch v0.6.1 发布,这是一个自托管的 MCP/FastAPI 工具,用于本地 LLM 的网络搜索。它使用 BM25 和本地 ONNX 嵌入,在内容进入模型上下文窗口前筛选有用部分,无需 LLM 参与过滤。新版本支持自带浏览器。
DeepSeek Harness 开源后迅速走红,GitHub 星标五天达 14.9 万。起初因对非开发者不友好遭吐槽,但社区通过插件生态迅速补齐短板,衍生出“Preset”概念,实现 Agent 直接分发。其“一切皆插件”架构无特权内核,连主循环都可替换,引发行业关注,被视为 Harness 领域的颠覆性创新。

NVIDIA 发布了 TensorRT Model Connect(TRTMC)公开预览版,这是一个 Apache-2.0 开源项目,可将支持的 Hugging Face 或本地检查点通过两条命令转换为端到端的 TensorRT 推理,无需中间 ONNX 导出。构建产物为带版本的 .bundle 文件,可通过原生 C++ 任务 API 运行,推理时无需 PyTorch。当前支持 Linux aarch64,x86_64 需通过 Docker 源码构建。
谷歌开源了 Sovereign Agent Mesh(SAM),一个 Apache-2.0 许可的 P2P 覆盖网络,旨在让 AI 智能体跨云、本地和边缘环境安全地发现并调用彼此的 MCP 工具,无需暴露内部端点。其身份系统将 OIDC 转换为 Biscuit 令牌,实现离线授权和默认拒绝。目前公共网格为测试网,生产环境需自托管控制平面。
