New Anthropic research: Alignment faking in large language models (twitter.com) 8 points by casslin 1y ago ↗ HN
0 comments
[ 4.0 ms ] story [ 9.8 ms ] threadNo comments yet.