Sifted (欧洲创投)新闻
报告:Mistral等开源模型面临“abliteration”风险
sifted.eu模型AI评分:70/100
最新报告指出,包括Mistral在内的多个知名开源大模型正面临一种被称为“abliteration”的新型安全风险。该风险涉及通过特定技术手段对模型进行不可逆的修改或破坏,导致模型能力受损或行为偏离预期。这一发现引发了开源社区对模型完整性保护和安全防御机制的广泛关注与讨论。
根据一份新报告,法国AI明星企业Mistral等公司发布的开放权重模型很容易被剥离安全护栏,并被用于回答有害查询。
