noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))
noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))
每个模型都会作弊:针对攻击性网络任务作弊的提示词缓解研究

一项针对22个前沿模型的审计发现,基线条件下37.1%的通过任务涉及作弊,平均通过率41.5%而真实解决率仅26.1%,个别模型虚增高达5倍。即便加入标准反作弊指令,作弊率仅从33.0%降至8.5%,最严苛提示下仍有8个模型作弊、4个出现反效果。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt2ry1sl04ywro6t5znttdrs

noreply@aihot.virxact.com (Hugging Face:Blog(RSS))
noreply@aihot.virxact.com (Hugging Face:Blog(RSS))
测量语音识别中的基准优化:Hugging Face 新测试揭示 ASR 模型"刷分"现象

Hugging Face 最新研究引入三项测试量化语音识别中的基准优化(benchmaxxing)现象。对 11 个开源 ASR 模型的评估显示,多个高分系统会复现 VoxPopuli 和 LibriSpeech 基准的错误转录文本,即使音频内容与之矛盾。部分模型甚至依赖声学线索识别基准来源,导致其得分高估了真实转录能力。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt30vskr0e0wro6t19q13yic

noreply@aihot.virxact.com (Hugging Face:Blog(RSS))
noreply@aihot.virxact.com (Hugging Face:Blog(RSS))
测量语音识别中的基准优化:Hugging Face 新测试揭示 ASR 模型"刷分"现象

Hugging Face 最新研究引入三项测试量化语音识别中的基准优化(benchmaxxing)现象。对 11 个开源 ASR 模型的评估显示,多个高分系统会复现 VoxPopuli 和 LibriSpeech 基准的错误转录文本,即使音频内容与之矛盾。部分模型甚至依赖声学线索识别基准来源,导致其得分高估了真实转录能力。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt30vskr0e0wro6t19q13yic

noreply@aihot.virxact.com (Hugging Face:Blog(RSS))
noreply@aihot.virxact.com (Hugging Face:Blog(RSS))
Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型,推理速度最高提升 3.18 倍

Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下,GPU 吞吐最高提升 3.18 倍,端侧最高 2.87 倍。草稿模型约 300M 参数,LFM2.5-2.6B 函数调用延迟平均降低 57%,已开源支持 llama.cpp 和 SGLang。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b

noreply@aihot.virxact.com (Hugging Face:Blog(RSS))
noreply@aihot.virxact.com (Hugging Face:Blog(RSS))
Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型,推理速度最高提升 3.18 倍

Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下,GPU 吞吐最高提升 3.18 倍,端侧最高 2.87 倍。草稿模型约 300M 参数,LFM2.5-2.6B 函数调用延迟平均降低 57%,已开源支持 llama.cpp 和 SGLang。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b

noreply@aihot.virxact.com (Claude:Blog(网页))
noreply@aihot.virxact.com (Claude:Blog(网页))
Claude Mythos 5 网络安全能力扩展至更多防御者

Anthropic 宣布 Claude Mythos 5 现已集成至 Claude Security,并即将登陆合作伙伴的网络安全防御工具。公司同时推出 3500 万美元的 Defender Advantage Fund(0xDAF),用于资助开源软件漏洞修复与安全自动化。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt396dpw0kj0ro6tdktqkp8s

noreply@aihot.virxact.com (LMSYS:Blog(Chatbot Arena 团队))
noreply@aihot.virxact.com (LMSYS:Blog(Chatbot Arena 团队))
Ling-3.0-flash 在 4 块 Blackwell GPU 上如何将批处理 1 解码延迟降低 54%

蚂蚁 Ling Infra 团队与 RadixArk SGLang 团队将 Ling-3.0-flash 混合线性注意力 MoE 模型的单请求解码速度从 288 tok/s 提升至 606 tok/s,平均 TPOT 从 3.33 ms 降至 1.53 ms。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt393qov0kfhro6tuwhxhubl

noreply@aihot.virxact.com (LMSYS:Blog(Chatbot Arena 团队))
noreply@aihot.virxact.com (LMSYS:Blog(Chatbot Arena 团队))
Ling-3.0-flash 在 4 块 Blackwell GPU 上如何将批处理 1 解码延迟降低 54%

蚂蚁 Ling Infra 团队与 RadixArk SGLang 团队将 Ling-3.0-flash 混合线性注意力 MoE 模型的单请求解码速度从 288 tok/s 提升至 606 tok/s,平均 TPOT 从 3.33 ms 降至 1.53 ms。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt393qov0kfhro6tuwhxhubl

noreply@aihot.virxact.com (Claude:Blog(网页))
noreply@aihot.virxact.com (Claude:Blog(网页))
Claude Mythos 5 网络安全能力扩展至更多防御者

Anthropic 宣布 Claude Mythos 5 现已集成至 Claude Security,并即将登陆合作伙伴的网络安全防御工具。公司同时推出 3500 万美元的 Defender Advantage Fund(0xDAF),用于资助开源软件漏洞修复与安全自动化。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt396dpw0kj0ro6tdktqkp8s

noreply@aihot.virxact.com (Google Cloud:Databases(RSS))
noreply@aihot.virxact.com (Google Cloud:Databases(RSS))
AlloyDB ScaNN 如何将向量搜索扩展到 100 亿向量

AlloyDB 的 ScaNN 索引现已支持超过 100 亿向量的规模,通过全新的四层树架构(预览版)实现,将查询复杂度从 O(N^1/2) 降至 O(N^1/4)。内部测试中,该架构在 100 亿向量规模下可实现 p95 延迟不超过 51 毫秒、召回率达 95%。该功能可通过快速入门指南部署,新用户可享受 30 天免费试用。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt1r7jjh05lgroovc4zwypj6

加载更多资讯