AI模型的记忆能不能自己长出安全意识?上海AI实验室做了个实验
这篇论文的标题里有个词特别扎眼,叫"Safety from Within",直译是"从内部而来的安全"。听起来有点玄乎,但拆开看,其实是在回答一个具体到不能再具体的工程问题:**能不能让模型用它存储历史信息的同一套机制,顺便也存储"该怎么安全地回应"这件事?*
这篇论文的标题里有个词特别扎眼,叫"Safety from Within",直译是"从内部而来的安全"。听起来有点玄乎,但拆开看,其实是在回答一个具体到不能再具体的工程问题:**能不能让模型用它存储历史信息的同一套机制,顺便也存储"该怎么安全地回应"这件事?*