在自由及开源软件贡献中使用大语言模型支持的生成式AI的建议
该页面由软件自由保护协会(Software Freedom Conservancy)发布,针对在自由及开源软件(FOSS)贡献中使用基于大语言模型(LLM)的生成式人工智能提出了具体建议和伦理指南。内容涵盖透明度、版权问题、代码来源追溯等关键议题,旨在帮助FOSS社区在遵循自由软件原则的前提下负责任地使用AI工具。
背景速读
- 软件自由保护协会(Software Freedom Conservancy,简称SFC)是一家总部在美国的非营利组织,专门为自由/开源软件(FOSS)项目提供法律和资金托管服务,其成员包括Git、QEMU、Inkscape等知名项目。
- 近年来,大型语言模型(LLM)和生成式AI工具(如GitHub Copilot、ChatGPT)被广泛用于编程,但它们训练时大量使用了未经明确许可的开源代码,引发了关于版权、许可证合规和伦理的争议。
- 2024年,SFC开始要求其托管项目的贡献者签署“反AI训练”声明,并公开建议开源社区不要使用LLM生成的代码,除非能严格验证其来源。本文是该组织对FOSS贡献中使用生成式AI的正式建议。
- 核心争议在于:LLM输出的代码往往无法追溯原始许可证,可能混入GPL等强传染性许可证的代码,导致项目面临法律风险;同时,SFC认为目前的技术无法满足自由软件要求的“透明度”和“知情同意”原则。
- 该立场在开源社区引发激烈讨论,支持者认为这是保护版权的必要措施,反对者则认为它阻碍了技术效率提升,并且难以执行。