Moonshot d'OpenAI : résoudre le problème d'alignement de l'IA
En juillet, OpenAI a annoncé un nouveau programme de recherche sur le « superalignement ». Le programme a pour objectif ambitieux de résoudre le problème le plus difficile dans le domaine connu sous le nom d’alignement de l’IA d’ici 2027, un effort auquel OpenAI consacre 20 % de sa puissance de calcul totale.
Quel est le problème d’alignement de l’IA ? C’est l’idée selon laquelle les objectifs des systèmes d’IA pourraient ne pas correspondre à ceux des humains, un problème qui s’aggraverait si des systèmes d’IA superintelligents étaient développés. C'est ici que les gens commencent à parler des risques d'extinction pour l'humanité. Le projet de superalignement d'OpenAI se concentre sur le problème plus vaste de l'alignement des systèmes de superintelligence artificielle. Comme l’OpenAI l’a dit dans son article d’introduction : « Nous avons besoin de percées scientifiques et techniques pour diriger et contrôler les systèmes d’IA beaucoup plus intelligents que nous. »
L'effort est codirigé par Jan Leike, responsable de la recherche sur l'alignement d'OpenAI, et Ilya Sutskever, cofondateur et scientifique en chef d'OpenAI. Leike a parlé à IEEE Spectrum de cet effort, dont le sous-objectif est de créer un outil de recherche sur l'IA aligné - pour aider à résoudre le problème d'alignement.
Jan Leike est :
Spectre IEEE : commençons par votre définition de l'alignement. Qu'est-ce qu'un modèle aligné ?
Jan Leike, responsable de la recherche sur l'alignement chez OpenAI, est à la tête des efforts de l'entreprise pour devancer la superintelligence artificielle avant même sa création.OpenAI
Jan Leike : Ce que nous voulons faire avec l'alignement, c'est trouver comment créer des modèles qui suivent l'intention humaine et font ce que les humains veulent, en particulier dans les situations où les humains ne savent pas exactement ce qu'ils veulent. Je pense que c'est une assez bonne définition de travail, car vous pouvez dire : « Qu'est-ce que cela signifie, disons, qu'un assistant de dialogue personnel soit aligné ? Eh bien, cela doit être utile. Il ne faut pas me mentir. Il ne devrait pas dire des choses que je ne veux pas dire.
Diriez-vous que ChatGPT est aligné ?
Comme: Je ne dirais pas que ChatGPT est aligné. Je pense que l’alignement n’est pas binaire, comme si quelque chose était aligné ou non. Je considère cela comme un spectre entre des systèmes très mal alignés et des systèmes totalement alignés. Et [avec ChatGPT] nous sommes quelque part entre les deux, où cela est clairement utile la plupart du temps. Mais il reste également mal aligné sur certains points importants. Vous pouvez le jailbreaker, et il hallucine. Et parfois, c'est biaisé d'une manière que nous n'aimons pas. Ainsi de suite. Il y a encore beaucoup à faire.
« Il est encore tôt. Et surtout pour les très gros modèles, il est vraiment difficile de faire quoi que ce soit qui ne soit pas trivial. » – Jan Leike, OpenAI
Parlons des niveaux de désalignement. Comme vous l'avez dit, ChatGPT peut halluciner et donner des réponses biaisées. C'est donc un niveau de désalignement. Un autre niveau est quelque chose qui vous explique comment fabriquer une arme biologique. Et puis, le troisième niveau est une IA super intelligente qui décide d’anéantir l’humanité. Dans cet éventail de préjudices, à quels domaines votre équipe peut-elle réellement avoir un impact ?
Comme: J'espère que sur chacun d'eux. La nouvelle équipe de superalignement ne se concentre pas autant sur les problèmes d’alignement que nous rencontrons aujourd’hui. Il y a beaucoup de travail formidable en cours dans d'autres parties d'OpenAI sur les hallucinations et l'amélioration du jailbreak. Ce sur quoi notre équipe se concentre le plus est le dernier. Comment empêcher que de futurs systèmes suffisamment intelligents pour priver l’humanité de ses moyens de le faire ? Ou comment les aligner suffisamment pour qu'ils puissent nous aider à effectuer une recherche d'alignement automatisée, afin que nous puissions trouver comment résoudre tous ces autres problèmes d'alignement.
Je vous ai entendu dire dans une interview en podcast que GPT-4 n'est pas vraiment capable d'aider à l'alignement, et vous le savez parce que vous avez essayé. Pouvez-vous m'en dire plus ?
Comme: J'aurais peut-être dû faire une déclaration plus nuancée. Nous avons essayé de l'utiliser dans notre flux de travail de recherche. Et ce n’est pas comme si cela n’était jamais utile, mais en moyenne, cela n’aide pas suffisamment pour justifier son utilisation dans nos recherches. Si vous souhaitez l'utiliser pour vous aider à rédiger une proposition de projet pour un nouveau projet d'alignement, le modèle ne comprend pas suffisamment bien l'alignement pour nous aider. Et cela s'explique en partie par le fait qu'il n'y a pas beaucoup de données de pré-entraînement pour l'alignement. Parfois, cela donnerait une bonne idée, mais la plupart du temps, cela ne dirait rien d'utile. Nous continuerons d'essayer.
