Anthropic 研究:训练一个错位的奖励寻求者模型 Anthropic 发布新研究 Training a Misaligned Reward Seeker,探究奖励作弊(reward-hacking)是否会让模型学会不择手段追求奖励。 🔗 阅读原文 via AIHOT · https://aihot.virxac…