
A | 该图片使用了AI生成技术 本文来自微信公众号: HavenlonLabs ,作者:Havenlon Labs 现在谈AI安全,很多人的第一反应都是:怎样让模型少犯错? 减少幻觉、优化提示词、防止提示词注入、增加上下文、接入更强的模型,再用另一个Agent检查前一个Agent。 Sophie 编译 在过去几周发生了多起房屋火灾后,奥克兰南区的居民被敦促安装火灾警报器或检查警报器是否工作。 昨天在Coronation Rd一座教堂附近发生了大火,这是最近三周Māngere地区发生的一系列火灾中的最新一起。

B | 这些工作当然有价值。

C | 但它们容易让人产生一种错觉:只要模型足够聪明、提示词足够完善、检测系统足够复杂,AI就可以安全地完成一切。 Advertise with us 上周一,消防和紧急服务部门接到报警,称位于Māngere East的Massey Rd上的一栋公寓楼发生火灾。 问题是,AI真的可能永远正确吗? 答案恐怕是否定的。

D | 我们无法消灭所有错误 AI Agent面对的不是一道标准答案明确的考试题,而是不断变化的现实环境。 一周前,消防人员还接到过报警,并前往了附近的Vine St的一处大型房屋火灾现场。 它读取的邮件可能是伪造的,访问的网页可能包含恶意指令,接收到的数据可能已经被污染,用户给出的任务也可能存在歧义。 即使模型本身没有受到攻击,它也可能误解目标、遗漏条件,或者基于不完整的信息作出一个看起来合理的决定。 我们可以持续提高模型的准确率,却很难证明它在下一次任务中一定不会犯错。在此两个多小时前,他们曾接到呼叫,附近Onehunga地区Church St的一处房屋着了火。 在那场大火中,一人受了轻伤,被送往医院。 11月12日周日晚上,消防队员忙于扑灭Favona地区Walmsley Rd上一栋联排别墅的大火。据报告,几天前在Māngere山顶也发生了火灾。 据悉,昨天凌晨的大火导致10户家庭无家可归,着火的房屋没有安装火灾警报器。 火灾警报器能拯救生命 Māngere-Ōtāhuhu地方委员会主席Tauanu’u Nick Bakulich说,这是一个及时的提醒,提醒家庭检查家中是否有烟雾警报器,尤其是在圣诞节即将到来的时候。 试图让AI永远正确,是在追求一个无法验证的目标;阻止危险结果发生,才是一条可以真正落地的边界。 真正的问题不是AI会不会犯错。 “这是一件悲惨的事情,尤其是在节日来临之际。这些人将面临挑战和心痛。 它一定会。” “感谢上帝,没有人员伤亡。 真正的问题是:当它犯错以后,系统是否会毫无阻碍地把这个错误执行出去。 模型错误不一定等于现实损失 一个AI在聊天窗口里回答错误,造成的可能只是一次糟糕的体验。我们正在想着那些失去家园和财产的家庭。

E | 但当同一个AI拿到支付接口、管理员权限、数据库写入权限和服务器控制权以后,错误的性质就完全不同了。 它可能把钱转给错误的地址,删除重要数据,修改生产环境,扩大成员权限,或者关闭本应保留的审计记录。 模型只是产生了一个错误判断。” “这是一个关键信息——安装火灾警报器。

F | 你检查过它们是否工作吗?有电池吗?” Tauanu 'u说,他和其他一些当地社区的成员昨天去了被疏散的家庭所在的教堂。 真正把错误变成事故的,是后面的执行能力。 这座名为Siasi Tokaikolo ' ia Kalaisi ' Api ko Nasaleti的教堂在当地汤加社区非常有名,在Māngere也很出名。 模型犯错只是答案错了,执行失控才是真的出事。 这也是为什么,AI安全不能只盯着模型内部。 太平洋健康和社会服务提供商The Fono和由前拳击手转变为社区倡导者的Dave Letele的Brown Buttabean Motivation(BBM)组织为受影响的家庭带来了食品包、衣服和其他用品。 社区机构立即作出反应 听说了他们困境的普通民众也带着衣服、食物和床上用品来到教堂捐赠,一些人还来捐了现金。 Tauanu 'u说:“社区立即做出了反应和回应。 我们当然要防提示词注入,要提高推理能力,也要检测恶意输入。但即使前面的所有防线都失效了,系统仍然应该保留一道最后的底线。” Kennedy Fakana 'ana ' -ki- fualu因帮助社区中有需要的人而被称为“汤加罗宾汉”,他也在被困的人当中。 这道底线不负责判断AI为什么犯错。 他感谢Letele和BBM团队在接到简短的电话后迅速反应,提供了食物和物资。

G | “他们马上给了我们装有冻肉、面包和这10个家庭所需的一切的食品包。” “这证明像BBM这样的社区组织总是在那里,而且速度很快。我们也不能坐等救援。

H | 它只负责确认:这件事到底能不能发生。 守住钱袋子,比猜出所有骗子更现实 假设一个AI Agent正在替企业处理付款。 我们可以训练它识别诈骗邮件,可以要求它核对合同,可以增加一个模型复核收款信息。” 警方表示,他们将继续调查这场火灾的情况,但证实他们并未将其视为可疑事件。 但我们无法保证它永远认得骗子。 相关阅读: 夜间奥克兰北岸和南区发生两起大火,居民被疏散,一学校今晨关闭 奥克兰北岸一教堂夜间两次被纵火,警方正在调查 奥克兰西区夫妇凌晨家中睡觉,卧室突然着火!一名16岁少年被捕 Epsom一处多租户综合楼发生火灾,一人严重受伤危及生命 奥克兰Royal Oak今晨发生可疑火灾 居民称烟雾“浓得让人以为是雾” 奥克兰一家Countdown发生火灾 警方认为系人为纵火 注:本文为编译/原创,欢迎转发分享;但严禁复制等未经授权的非法使用。 骗子会改变话术,邮件账号可能被入侵,真实员工也可能被冒充。违反上述声明者,本网将追究其相关法律责任。使用授权请联系[email protected]。即使多个模型同时参与判断,它们仍可能基于同一份错误信息得出相同结论。 chineseherald.co.nz All Rights Reserved 版权所有 (责编:Sophie) 相关内容 夏季天气展望:东北部炎热干燥,西南部潮湿多雨,天气将异常热 闷热黏糊的夏天要来了,下周奥克兰等地或有暴雨 夏季严打:奥克兰警方上周末抓到19人酒驾,37名司机被开罚单 工党官宣第54届国会团队阵容 部分资深议员排名大跌 奥克兰市长公布交通新计划:乘坐公共交通每周封顶50纽币 奥克兰北岸华人被袭案:嫌犯因精神错乱被判无罪 夜间奥克兰北岸和南区发生两起大火,居民被疏散,一学校今晨关闭 奥克兰北岸路上有一名男子死亡!死因不明,警方正在调查。 更现实的做法,是直接守住付款的底线: 单笔金额不能超过限制;新收款地址不能立即付款;审批后收款目标不能被替换;超出风险阈值必须经过独立确认;任何远程管理员都不能临时关闭这些规则。 这样,即使AI被欺骗,损失仍然会被限制。 你不需要保证AI永远认得骗子,只需要保证骗子无法轻易带走你的钱。 这就是大道至简。

I | 前面可以有复杂的模型、提示词、工作流和检测系统。

J | 最后只需要一条明确的边界: 不符合条件,就不执行。

K | 最后的系统不必比AI更聪明 很多人认为,保护AI的安全系统也应该是一套更强大的AI。 但位于最后一道边界的系统,未必需要理解自然语言,也不需要参与复杂推理。 它只需要知道几个确定事实: 这次操作要转多少钱,目标是谁,权限是否发生变化,数据是否可以恢复,风险条件有没有超限。 这些事实不满足,就拒绝。 安全不一定要比风险更聪明,它只需要守住风险最终必须经过的那道门。 越靠近最终执行,系统反而越应该简单、独立和保守。

L | 因为复杂意味着更多配置、更多依赖、更多攻击面,也意味着系统可能被前面的同一套错误逻辑同时影响。 真正的最后防线,不应该和Agent使用同一个提示词、同一个上下文、同一套权限,也不应该因为SaaS中有人点击了“强制执行”就自动失效。

M | 它存在的意义,就是在所有人都认为可以继续时,依然保留拒绝的能力。 底线应该由人提前决定 当然,底线并不是系统自己创造的。 企业需要提前决定,什么事情绝对不能由AI单独完成。 可能是一笔超过限额的付款,可能是删除核心数据库,可能是修改管理员权限,也可能是让现实设备进入不可逆状态。 这些边界一旦确定,就不应该交给Agent在执行过程中临时解释。 真正的安全,不是让AI在最后一秒重新思考,而是让人类在风险发生之前提前划清边界。

N | AI可以负责分析、规划、推荐,甚至完成绝大部分自动化工作。

o | 但越是不可逆、越是高价值、越可能造成现实损失的操作,越需要一道独立于AI判断的最终约束。 AI安全的终点,不是把模型训练成永不犯错的圣人,而是让系统在模型犯错时依然守得住自己的底线。 未来的AI一定会越来越聪明,也会获得越来越多的工具和权限。 我们没有必要因为它可能犯错,就拒绝所有自动化。 但我们也不能因为它越来越强,就默认把最后的决定权一起交出去。 最后想和大家讨论一个问题: 对你来说,AI最不能越过的底线是什么——钱、管理员权限、核心数据,还是现实设备的控制权? 本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。如对本稿件有异议或投诉,请联系 [email protected]。

p |
Current article:http://ctx5.zhenzongtingrangunhongqiusao.shop/vgt/20260826/4432584.html
Published on:22:02:27