名下多出15台车

AI 不需要永远正确,我们只需要守住最后一道底线_我的网站

春妮的周末时光

一 |     11月24日,市委副书记、市长、市政府党组书记王庆海主持召开市政府党组会议和常务会议,认真学习贯彻习近平总书记重要讲话和指示批示精神,传达学习省市厅级主要领导干部学习贯彻党的二十届三中全会精神专题研讨班培训精神,学习贯彻新修改的《中华人民共和国统计法》,按照市委工作部署,研究发展冰雪经济、维护安全稳定、冬季供暖、矿山安全、统计工作等重点事项。    该图片使用了AI生成技术          本文来自微信公众号: HavenlonLabs ,作者:Havenlon Labs          现在谈AI安全,很多人的第一反应都是:怎样让模型少犯错?          减少幻觉、优化提示词、防止提示词注入、增加上下文、接入更强的模型,再用另一个Agent检查前一个Agent。         这些工作当然有价值。           会议强调,要深入贯彻习近平总书记在二十届中央政治局第十七次集体学习时的重要讲话精神,落实《国务院办公厅关于以冰雪运动高质量发展激发冰雪经济活力的若干意见》,按照省委、省政府打造高品质文体旅融合发展示范地要求,以承办“十五冬”雪上赛事为契机,加快推动龙岗山滑雪场等重点冰雪项目建设,举办系列群众性冰雪文体活动,以冰雪运动为引领,带动冰雪文化、冰雪旅游、冰雪装备全产业链发展,努力打造热门冰雪旅游目的地城市,切实放大“办好一个会、提升一座城”的综合效应。           会议强调,要深入贯彻习近平总书记对社会工作的重要指示精神,突出抓好新经济组织、新社会组织、新就业群体的党建工作,强化党建引领基层治理,形成做好社会工作的强大合力。         但它们容易让人产生一种错觉:只要模型足够聪明、提示词足够完善、检测系统足够复杂,AI就可以安全地完成一切。         问题是,AI真的可能永远正确吗?          答案恐怕是否定的。

二 | 要深入贯彻习近平总书记对广东珠海市驾车冲撞行人案件作出的重要指示精神,举一反三做好风险源头防控,完善应急处置机制,提升应急处突能力,严防极端案件发生,全力保障人民群众生命安全和社会稳定。

三 |            会议强调,要深入学习贯彻习近平总书记对民政工作的重要指示精神,坚持以人民为中心,加强普惠性、基础性、兜底性民生建设。         我们无法消灭所有错误          AI Agent面对的不是一道标准答案明确的考试题,而是不断变化的现实环境。各县区各部门要主动作为、协同联动,切实办好教育、医疗、住房、养老等事关群众切身利益的民生实事,做好拥军优属、食品安全等民生保障工作,认真落实积极应对人口老龄化国家战略,积极探索抚顺养老新路径,不断提升人民群众幸福感、获得感、安全感。要随时关注天气变化,密切跟踪雨雪降温全过程,做好动态监测研判,及时发布天气预报、出行提示信息和民生保障部门服务热线,视天气变化做好保供、保畅、供暖、除雪等工作,全力保障人民群众正常生产生活。         它读取的邮件可能是伪造的,访问的网页可能包含恶意指令,接收到的数据可能已经被污染,用户给出的任务也可能存在歧义。               会议还研究了其他事项。

四 |          即使模型本身没有受到攻击,它也可能误解目标、遗漏条件,或者基于不完整的信息作出一个看起来合理的决定。                   责任编辑:刘春阳。         我们可以持续提高模型的准确率,却很难证明它在下一次任务中一定不会犯错。

五 |          试图让AI永远正确,是在追求一个无法验证的目标;阻止危险结果发生,才是一条可以真正落地的边界。

六 |          真正的问题不是AI会不会犯错。         它一定会。         真正的问题是:当它犯错以后,系统是否会毫无阻碍地把这个错误执行出去。         模型错误不一定等于现实损失          一个AI在聊天窗口里回答错误,造成的可能只是一次糟糕的体验。         但当同一个AI拿到支付接口、管理员权限、数据库写入权限和服务器控制权以后,错误的性质就完全不同了。         它可能把钱转给错误的地址,删除重要数据,修改生产环境,扩大成员权限,或者关闭本应保留的审计记录。

七 |          模型只是产生了一个错误判断。         真正把错误变成事故的,是后面的执行能力。         模型犯错只是答案错了,执行失控才是真的出事。         这也是为什么,AI安全不能只盯着模型内部。         我们当然要防提示词注入,要提高推理能力,也要检测恶意输入。但即使前面的所有防线都失效了,系统仍然应该保留一道最后的底线。

八 |          这道底线不负责判断AI为什么犯错。

九 |          它只负责确认:这件事到底能不能发生。

十 |          守住钱袋子,比猜出所有骗子更现实          假设一个AI Agent正在替企业处理付款。         我们可以训练它识别诈骗邮件,可以要求它核对合同,可以增加一个模型复核收款信息。

十一 |          但我们无法保证它永远认得骗子。         骗子会改变话术,邮件账号可能被入侵,真实员工也可能被冒充。即使多个模型同时参与判断,它们仍可能基于同一份错误信息得出相同结论。

十二 |          更现实的做法,是直接守住付款的底线:          单笔金额不能超过限制;新收款地址不能立即付款;审批后收款目标不能被替换;超出风险阈值必须经过独立确认;任何远程管理员都不能临时关闭这些规则。         这样,即使AI被欺骗,损失仍然会被限制。         你不需要保证AI永远认得骗子,只需要保证骗子无法轻易带走你的钱。

十三 |          这就是大道至简。         前面可以有复杂的模型、提示词、工作流和检测系统。         最后只需要一条明确的边界:          不符合条件,就不执行。         最后的系统不必比AI更聪明          很多人认为,保护AI的安全系统也应该是一套更强大的AI。         但位于最后一道边界的系统,未必需要理解自然语言,也不需要参与复杂推理。         它只需要知道几个确定事实:          这次操作要转多少钱,目标是谁,权限是否发生变化,数据是否可以恢复,风险条件有没有超限。

十四 |          这些事实不满足,就拒绝。

十五 |          安全不一定要比风险更聪明,它只需要守住风险最终必须经过的那道门。

十六 |          越靠近最终执行,系统反而越应该简单、独立和保守。         因为复杂意味着更多配置、更多依赖、更多攻击面,也意味着系统可能被前面的同一套错误逻辑同时影响。         真正的最后防线,不应该和Agent使用同一个提示词、同一个上下文、同一套权限,也不应该因为SaaS中有人点击了“强制执行”就自动失效。         它存在的意义,就是在所有人都认为可以继续时,依然保留拒绝的能力。         底线应该由人提前决定          当然,底线并不是系统自己创造的。         企业需要提前决定,什么事情绝对不能由AI单独完成。         可能是一笔超过限额的付款,可能是删除核心数据库,可能是修改管理员权限,也可能是让现实设备进入不可逆状态。

十七 |          这些边界一旦确定,就不应该交给Agent在执行过程中临时解释。         真正的安全,不是让AI在最后一秒重新思考,而是让人类在风险发生之前提前划清边界。

十八 |          AI可以负责分析、规划、推荐,甚至完成绝大部分自动化工作。         但越是不可逆、越是高价值、越可能造成现实损失的操作,越需要一道独立于AI判断的最终约束。         AI安全的终点,不是把模型训练成永不犯错的圣人,而是让系统在模型犯错时依然守得住自己的底线。         未来的AI一定会越来越聪明,也会获得越来越多的工具和权限。         我们没有必要因为它可能犯错,就拒绝所有自动化。

十九 |          但我们也不能因为它越来越强,就默认把最后的决定权一起交出去。         最后想和大家讨论一个问题:          对你来说,AI最不能越过的底线是什么——钱、管理员权限、核心数据,还是现实设备的控制权?          本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。

| 如对本稿件有异议或投诉,请联系 [email protected]

Current article:http://utl.foujiongwenruapoumeizhan.buzz/456/bhqm9.html

Published on:02:45:27


我的网站最近更新

我的网站热门资讯