• 软件下载
  • 源码下载
  • 在线工具
  • 网页教程基础
  • 服务器常用软件
  • 手机版
  • 关注微信
特搜战队刑事连者
  • 网页制作
  • 网络编程
  • 脚本专栏
  • 脚本下载
  • 数据库
  • CMS教程
  • 电子书籍
  • 平面设计
  • 媒体动画
  • 操作系统
  • 网站运营
  • 网络安全
  • 在线手册
您的位置: 主页 > 网站运营 > 建站经验 >

作者:通宗北华 字体:[增加 减小] 来源:日历 时间:2026-08-27 我要评论

特搜战队刑事连者

NASA's Webb telescope captures portrait of Pillars of Creation_我的网站

巨星秀

一 |     该图片使用了AI生成技术          本文来自微信公众号: HavenlonLabs ,作者:Havenlon Labs          现在谈AI安全,很多人的第一反应都是:怎样让模型少犯错?          减少幻觉、优化提示词、防止提示词注入、增加上下文、接入更强的模型,再用另一个Agent检查前一个Agent。    Los Angeles, Oct 20 (UNI) NASA's James Webb Space Telescope has captured the iconic Pillars of Creation, where new stars are forming within dense clouds of gas and dust, the agency said.



The three-dimensional pillars look like majestic rock formations, but are far more permeable. These columns are made up of cool interstellar gas and dust that appear semi-transparent in near-infrared light, according to NASA on Wednesday.



Webb's new view of the Pillars of Creation, which were first made famous when imaged by NASA's Hubble Space Telescope in 1995, will help researchers revamp their models of star formation by identifying far more precise counts of newly formed stars, along with the quantities of gas and dust in the region, said NASA.



UNI/XINHUA PRT。         这些工作当然有价值。         但它们容易让人产生一种错觉:只要模型足够聪明、提示词足够完善、检测系统足够复杂,AI就可以安全地完成一切。         问题是,AI真的可能永远正确吗?          答案恐怕是否定的。

二 |          我们无法消灭所有错误          AI Agent面对的不是一道标准答案明确的考试题,而是不断变化的现实环境。

三 |          它读取的邮件可能是伪造的,访问的网页可能包含恶意指令,接收到的数据可能已经被污染,用户给出的任务也可能存在歧义。         即使模型本身没有受到攻击,它也可能误解目标、遗漏条件,或者基于不完整的信息作出一个看起来合理的决定。         我们可以持续提高模型的准确率,却很难证明它在下一次任务中一定不会犯错。         试图让AI永远正确,是在追求一个无法验证的目标;阻止危险结果发生,才是一条可以真正落地的边界。

四 |          真正的问题不是AI会不会犯错。         它一定会。         真正的问题是:当它犯错以后,系统是否会毫无阻碍地把这个错误执行出去。

五 |          模型错误不一定等于现实损失          一个AI在聊天窗口里回答错误,造成的可能只是一次糟糕的体验。         但当同一个AI拿到支付接口、管理员权限、数据库写入权限和服务器控制权以后,错误的性质就完全不同了。         它可能把钱转给错误的地址,删除重要数据,修改生产环境,扩大成员权限,或者关闭本应保留的审计记录。         模型只是产生了一个错误判断。         真正把错误变成事故的,是后面的执行能力。         模型犯错只是答案错了,执行失控才是真的出事。         这也是为什么,AI安全不能只盯着模型内部。         我们当然要防提示词注入,要提高推理能力,也要检测恶意输入。但即使前面的所有防线都失效了,系统仍然应该保留一道最后的底线。

六 |          这道底线不负责判断AI为什么犯错。

七 |          它只负责确认:这件事到底能不能发生。         守住钱袋子,比猜出所有骗子更现实          假设一个AI Agent正在替企业处理付款。         我们可以训练它识别诈骗邮件,可以要求它核对合同,可以增加一个模型复核收款信息。         但我们无法保证它永远认得骗子。         骗子会改变话术,邮件账号可能被入侵,真实员工也可能被冒充。即使多个模型同时参与判断,它们仍可能基于同一份错误信息得出相同结论。

八 |          更现实的做法,是直接守住付款的底线:          单笔金额不能超过限制;新收款地址不能立即付款;审批后收款目标不能被替换;超出风险阈值必须经过独立确认;任何远程管理员都不能临时关闭这些规则。         这样,即使AI被欺骗,损失仍然会被限制。

九 |          你不需要保证AI永远认得骗子,只需要保证骗子无法轻易带走你的钱。         这就是大道至简。         前面可以有复杂的模型、提示词、工作流和检测系统。

十 |          最后只需要一条明确的边界:          不符合条件,就不执行。

十一 |          最后的系统不必比AI更聪明          很多人认为,保护AI的安全系统也应该是一套更强大的AI。         但位于最后一道边界的系统,未必需要理解自然语言,也不需要参与复杂推理。         它只需要知道几个确定事实:          这次操作要转多少钱,目标是谁,权限是否发生变化,数据是否可以恢复,风险条件有没有超限。         这些事实不满足,就拒绝。         安全不一定要比风险更聪明,它只需要守住风险最终必须经过的那道门。         越靠近最终执行,系统反而越应该简单、独立和保守。         因为复杂意味着更多配置、更多依赖、更多攻击面,也意味着系统可能被前面的同一套错误逻辑同时影响。         真正的最后防线,不应该和Agent使用同一个提示词、同一个上下文、同一套权限,也不应该因为SaaS中有人点击了“强制执行”就自动失效。         它存在的意义,就是在所有人都认为可以继续时,依然保留拒绝的能力。         底线应该由人提前决定          当然,底线并不是系统自己创造的。         企业需要提前决定,什么事情绝对不能由AI单独完成。         可能是一笔超过限额的付款,可能是删除核心数据库,可能是修改管理员权限,也可能是让现实设备进入不可逆状态。

十二 |          这些边界一旦确定,就不应该交给Agent在执行过程中临时解释。         真正的安全,不是让AI在最后一秒重新思考,而是让人类在风险发生之前提前划清边界。

十三 |          AI可以负责分析、规划、推荐,甚至完成绝大部分自动化工作。         但越是不可逆、越是高价值、越可能造成现实损失的操作,越需要一道独立于AI判断的最终约束。         AI安全的终点,不是把模型训练成永不犯错的圣人,而是让系统在模型犯错时依然守得住自己的底线。         未来的AI一定会越来越聪明,也会获得越来越多的工具和权限。

十四 |          我们没有必要因为它可能犯错,就拒绝所有自动化。         但我们也不能因为它越来越强,就默认把最后的决定权一起交出去。         最后想和大家讨论一个问题:          对你来说,AI最不能越过的底线是什么——钱、管理员权限、核心数据,还是现实设备的控制权?          本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。如对本稿件有异议或投诉,请联系 [email protected]。

Current article:http://207yxy4.chaochangkuanbandangyogeseng.sbs/8c0tm/s66cm.html

Published on:00:00:00


Tag:靳东疑暗讽金星   running man  ???ڇ?;  

相关文章

  • 08-27去哪儿酒店退订退款
  • 08-27OPPO K10家族新成员,OPPO K10x惊喜上线_闪充_机型
  • 08-25国家医保局印发指导意见 规范长期护理保险报销管理
  • 08-22坐滩舰断粮50天?终于收到中方放行,菲军该庆幸对手是中国,周扒皮侃历史,原创 坐滩舰断粮50天?终于收到中方放行,菲军该庆幸对手是中国
  • 08-22北交所上市公司彩客科技登龙虎榜:当日换手率达到22.54%
  • 08-23商务部:中国已成为厄瓜多尔第二大贸易伙伴

文章分类

  • 建站经验
  • 网站优化
  • 网站策划
  • 网络赚钱
  • 网络创业
  • 站长故事
  • alexa域名
  • 其它相关

大家感兴趣的内容

  • 1此行间·以文塑旅、以旅彰文,总书记为何强调文和旅的融合?
  • 2巴恩斯主动削减出手强化防守 具备争冠基石潜质
  • 3谷歌:新的数据中心预计将100%使用可再生能源
  • 4第十四届全国见义勇为模范颜国庆10万奖金全额捐赠
  • 5WoF,路税贴纸都要取消了么?交通部长这么说……
  • 6生态文明建设,全国能向湖州学什么?
  • 7漫威 × 乐高联手整活:《复仇者联盟 5:毁灭之日》乐高版预告发布,毁灭日秒变积木危机
  • 814층 아파트서 떨어진 7세 남아…나무에 먼저 떨어져 '찰과상'
  • 9高速だって走れちゃう! 車検不要でコスパもグッド “普通二輪AT限定免許”で楽しめるホンダの個性派「軽二輪スクーター」3選
  • 10上海:聚焦集成电路、人工智能等重点产业和关键领域 壮大出口优势

最近更新的内容

  • Naslen Gafoor Turns 25: The Unassuming Meteor Of Malayalam Cinema
  • 本菲卡计划今夏与曼城商谈B席转会,但不会付5000万镑解约金
  • 山东专属!超级大乐透套餐票1000万元赠票活动今晚开启
  • 荒诞、猎奇与诅咒...这款点击解谜游戏为何经久不衰?
  • 夜间奥克兰的快餐店和民宅遭砸抢,居民被袭击,一人受伤
  • 左右没有对错,但极端带来灾难
  • 独行侠两高管月初突然离职 均为前GM所聘
  • Bihar Politics: राजनीतिक दलों से जुड़े हैं लाखों वकील SIR के प्रति नहीं हैं सजग; BLO को जागरूक करने में फिसड्डी
  • China's Galbot robot takes on tennis star Zheng Jie in world's first human-robot match
  • 体育营销Top10|李宁发布亚运会中国队领奖装备 全红婵代言黄子韬品牌

关于我们 - 广告合作 - 联系我们 - 免责声明 - 网站地图 - 网站地图 - 投诉建议 - 在线投稿 -

©CopyRight 2020-2099 特搜战队刑事连者 Inc All Rights Reserved. 特搜战队刑事连者 版权所有