Skip to content
TopicTracker
出典 HackerNews原文を表示
翻訳言語翻訳言語

Show HN: Tested – AI Tools Scored by a Panel of LLMs (Claude, GPT, Gemini, Grok)

Testedは、Claude、GPT、Gemini、Grokなどの複数の大規模言語モデル(LLM)を審査員として活用し、AIツールを評価・スコアリングするプラットフォームです。異なるLLMの総合的な判断に基づいて、各AIツールのパフォーマンスを客観的に比較することができます。

背景メモ

- Tested (trytested.com) は、複数の主要な大規模言語モデル(Claude、GPT、Gemini、Grok)を評価パネルとして使い、AIツールのスコアリングとレビューを行う新しいサイト。いわば「LLMによるLLMのためのレコメンドエンジン」 - 通常のAIツールの比較サイトは人間のレビュアーやユーザー評価に依存するが、TestedはAI自身に他のAIツールを評価させるアプローチを採用。これにより、レビューの一貫性やカバレッジの拡大を狙う - 評価に使われるLLMのうち、Claude(Anthropic)、GPT(OpenAI)、Gemini(Google)、Grok(xAI)はいずれも最先端のモデルだが、それぞれトレーニングデータや設計思想が異なるため、同じツールに対する評価にもばらつきが出る可能性がある - Hacker News(Show HN)に投稿された初期プロジェクトであり、評価方法論の妥当性や、AIによるAI評価という循環の信頼性がコミュニティの関心を集めている

関連記事