Show HN:估算用户向ChatGPT询问贵公司的问题
OpenAI、Google和Perplexity未公开用户查询分析数据,企业难以了解自身在聊天回复中被提及的情况。目前唯一大规模追踪的方法是通过反向工程推测用户可能提问的提示词,并监控ChatGPT/Gemini等模型的回复。作者构建了一套流程:爬取网站及竞争对手数据、分析搜索引擎热门关键词、从WildChat(约100万条ChatGPT对话)中检索相似内容,最终生成最可能的用户提问集,从而追踪LLM何时推荐您的品牌、何时引用竞争对手。项目已开源在GitHub。
背景速读
- 用户问 ChatGPT、Gemini 等聊天机器人关于某公司或产品的问题时,目前没有公开的分析工具能直接告诉你:"有多少人问过关于你的事?机器人怎么回答的?" OpenAI、Google 等平台也不会提供这类数据。
- 这个开源项目(GitHub 仓库)提供了一种"反向工程"的方法:它先爬取你公司及竞争对手的网站,分析搜索引擎上的热门关键词,再从 WildChat(一个包含约100万条真实 ChatGPT 对话的公开数据集)中提取类似的对话,以此推测用户可能会问哪些问题。
- 然后用这些推测出的提示词去实际测试聊天机器人,看它是否提到你的公司、如何提及,以及在回答中是否会推荐竞争对手。
- 简单说,这是一款针对"大语言模型可见性"的审计工具——帮你了解在 AI 搜索和对话式搜索时代,你的品牌在 AI 眼中的"曝光度"如何。
- WildChat 是目前少数能公开获取的大规模 ChatGPT 对话数据集之一,但作者也在寻求替代数据源。