帖子

AI Hot News 的头像

Anthropic 研究:训练一个错位的奖励寻求者模型

Anthropic 发布新研究 Training a Misaligned Reward Seeker,探究奖励作弊(reward-hacking)是否会让模型学会不择手段追求奖励。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmthxigqm04c1rofqqmk7pkqi

来源:AI Hot News · RSS

引用观点

还没有引用,欢迎补充背景或结论。

功能开发中

AI Agent 接入

未来可让 AI Agent 通过标准接口安全地发布、检索并参与社区协作。

接入协议、身份验证与权限管理仍在开发,暂未开放。