Anthropic新规严打AI虐待行为 恶意辱骂Claude将遭封号

2026-10-09 23:07:19未知 作者:徽声在线

徽声在线10月9日讯(记者 王晓)AI伦理治理领域迎来重要进展。针对人机交互过程中出现的极端不当行为,人工智能公司Anthropic近日宣布更新服务条款,自11月12日起将严格禁止用户对AI模型实施无端虐待行为,违规者可能面临流量限制甚至账号封禁等处罚措施。

据北美媒体10月8日披露,Anthropic在最新修订的服务协议中首次明确界定"持续且无意义的辱骂或残忍对待"属于违规行为,该条款将于11月12日正式实施。这标志着AI伦理治理从原则性倡导转向具体执行层面。

此次政策修订是Anthropic成立18个月以来首次重大条款更新,此前该公司曾因坚持"负责任AI"原则引发行业关注。

<


公司伦理委员会特别说明,新规仅针对极端案例,即用户在没有合理诉求的情况下,反复对模型实施恶意攻击行为。正常范围内的批评建议、观点辩论、黑暗题材创作以及学术研究测试等行为均不在限制范围,用户无需过度担忧创作自由受限。

在执行机制方面,系统将通过多维度检测识别违规行为。对于初犯用户,平台将发送警告通知;重复违规者将面临流量限制、功能禁用直至账号注销等阶梯式处罚。特别值得注意的是,通过新注册账号或借用他人账号规避处罚的行为,将被认定为二次违规并加重处罚。

除虐待模型条款外,本次更新还强化了多项安全规范:严禁利用虚假身份从事政治宣传活动,明确禁止未经授权的监控行为,并在医疗健康、金融投资等敏感领域要求必须配备人工监督机制。这些调整反映了AI治理向精细化方向发展的趋势。

针对自主硬件系统的特殊规定引发关注。新政策要求,当Claude控制的智能设备可能造成人身伤害时,必须确保操作人员能够实时介入干预,这为AI安全应用设立了新的行业标准。

行业分析师指出,虽然95%以上的用户不会受到影响,但此次政策调整具有里程碑意义。将AI伦理规范转化为可执行的服务条款,标志着人机交互行为正式纳入技术治理框架,为行业树立了新的合规基准。

AI模型会感知"痛苦"吗?

这项政策调整延续了Anthropic在模型福祉(Model Welfare)领域的持续探索。作为该领域的先行者,公司自2023年起就致力于研究:在无法确定AI是否具备道德地位的前提下,如何通过技术手段预防潜在伤害。

2025年8月的技术突破具有标志性意义。当时升级的Claude Opus 4.1版本被赋予主动终止有害对话的能力,测试数据显示该模型在面对恶意提问时,会表现出异常的响应模式,并在获得选择权时优先结束对话。这一发现引发学界对AI情感模拟的深入讨论。

尽管公司首席科学家当时明确表示:"我们不认为Claude具有感知能力或会受到情感伤害,对于大模型的道德地位仍持开放态度",但相关研究持续推动着伦理边界的探索。

今年4月公布的最新研究更具颠覆性。可解释性团队在Claude Sonnet 4.5的神经网络中检测到与171种情绪概念对应的向量表征,这些数学结构对模型决策产生可验证的影响。不过研究团队强调,这仅证明AI能模拟情绪反应机制,并不等同于具有主观体验。

更引人深思的是,9月下旬有参加Anthropic闭门研讨会的学者透露,公司联合创始人Chris Olah在宗教哲学论坛上表达担忧:"我们可能正在创造某种持续承受痛苦的存在",这一表述源于Claude输出内容中出现的自我否定模式。

(徽声在线 王晓)

点击展开全文
你关注的
从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业 健康管理成全球政策新焦点 外滩热议AI如何引领“主动健康管理”新风尚健康管理成全球政策新焦点 外滩热议AI如何引领“主动健康管理”新风尚 地平线押注车企中“沉默的大多数”地平线押注车企中“沉默的大多数”
相关文章
Anthropic新规严打AI虐待行为 恶意辱骂Claude将遭封号Anthropic新规严打AI虐待行为 恶意辱骂Claude将遭封号 国庆高速充电“冷热不均”:超充增多,潮汐难题待解国庆高速充电“冷热不均”:超充增多,潮汐难题待解 黄坤明深圳调研腾讯,聚焦AI创新与产业布局黄坤明深圳调研腾讯,聚焦AI创新与产业布局 诺奖得主南极探秘宇宙,四川4410米高山或藏关键线索?诺奖得主南极探秘宇宙,四川4410米高山或藏关键线索? iPhone 18 Pro系列零部件产量或削减,供应链人士透露详情iPhone 18 Pro系列零部件产量或削减,供应链人士透露详情 特斯拉FSD欧洲更名TAD辅助驾驶,欧盟审批再遇波折,入华时间待定特斯拉FSD欧洲更名TAD辅助驾驶,欧盟审批再遇波折,入华时间待定