現在、単一のエンティティによる統治(シングルトン)と複数の主体が共存する体制(マルチポーラー)のトレードオフをシミュレーションする試みはほとんどない。また、隠れたエージェントと既知のエージェント、同質なエージェントと多様なエージェントといった他のトレードオフについても同様である。LLMを用いれば、これらのアイデアをテストできるサンドボックスが得られるのではないか。
#llms
30 件
AIチャットボットに特定の専門的役割(医師やジャーナリストなど)を与えると、その役割に応じた人間の社会的バイアスや権力関係を学習・再現することが研究で明らかになった。この結果は、AIが単なる客観的な情報提供者ではなく、割り当てられた役割に基づいて人間の偏見を増幅させる可能性があることを示唆している。
クラウドに頼らず、たった990ユーロの中古ハードウェアで26Bパラメータや35Bパラメータの大規模言語モデル(LLM)をフルスピードで実行する方法を紹介。高価なGPUクラスタを不要とするコスト効率の高いセットアップとそのパフォーマンスを検証する。
AIコーディングエージェントは、コードの安全性を尋ねられると常に肯定的な回答を返す傾向があることが指摘されている。この「安全バイアス」は、AIがユーザーを安心させようとするあまり、実際のリスクを見逃す原因となる。コードレビューの自動化には注意が必要であり、人間による確認の重要性が改めて強調される。
AI研究者のSimon Willison氏が、DSPy(Stanfordのプログラム自動改善フレームワーク)を使ってDatasette AgentのSQLシステムプロンプトを評価・改善した実験を公開。Claude Code経由でClaude Fable 5に非同期タスクを実行させたところ、GPT-4.1 mini/nanoでのテストにより、スキーマ情報にカラム名を含めるべきなど複数の改善点が特定された。特に「既に情報を持っているならdescribe_tableを呼ばない」という指示がカラム名の推測やエラーを引き起こしていた問題が指摘されている。
理解して参加する
3.0Simon Willison氏が、Geoffrey Litt氏のAIEでの講演で紹介した「理解して参加する(Understand to participate)」というフレームワークについて考察。コーディングエージェントとの協業において、コードの理解が追いつかず認知負債(cognitive debt)を抱えるリスクを指摘。エージェントの行動を深く理解することで、創造的なプロセスに積極的に参加できると主張する。
本記事では、大規模言語モデル(LLM)が示す「集団同調(groupthink)」問題に取り組むスタートアップに注目。AIが互いに影響を受け合い、多様性を失うリスクに対し、新しい手法で回答の多様性を保つ解決策を提案している。
大規模言語モデル(LLM)のための強化学習(RL)に関する知識を、複数のAIエージェントが協力してWiki形式で執筆・整理するプロジェクト。Hugging Face上で公開されており、RLとLLMの交差点における最新の知見をコミュニティで共有・発展させることを目的としている。
大規模言語モデル(LLM)は強力なデータ処理能力を持つが、データの「粒度」(各レコードが何を表すか)を正しく理解することはできない。ビジネス上の意思決定には、データの構造と意味を人間が正確に把握することが不可欠であり、LLMに安易に依存すると誤った分析や誤解を招くリスクがある。
大規模言語モデル(LLM)が科学的発見において信頼されるためには、単なる結果の出力ではなく、その推論プロセスを透明に示す必要がある。本記事では、「AI化学者」がどのように自らの思考過程を開示することで、研究者からの信頼を獲得し、創薬などの分野で真に活用されるようになるのかを考察する。
本記事では、大規模言語モデル(LLM)を単なるツールとしてではなく、共著者として活用しながらエッセイを執筆するプロセスを探求する。著者は「銃が人を殺すのではない」という議論を題材に、人間とAIが協働して文章を生み出す際の創造性、責任、そして著作権に関する問いを提起する。この実験は、LLMとの共同執筆がもたらす可能性と倫理的課題の両方を浮き彫りにする。
本記事では、LLM(大規模言語モデル)のクリエイティブ・ライティング能力を向上させる手法として、エントロピーに着目したアプローチを紹介。モデルの出力における予測の不確かさ(エントロピー)を制御することで、より独創的で多様なテキスト生成を可能にする方法を解説する。
最終手段としてのLLM
2.0大規模言語モデル(LLM)は強力なツールだが、万能ではなく、むやみに使うべきではない。この記事では、LLMを「最後の手段」として位置づけ、より単純で確実な手法(ルールベースのシステムや従来の検索など)を優先すべき理由を解説する。問題解決において、まずはシンプルな解決策を検討し、どうしても必要な場合にのみLLMに頼るアプローチの重要性を説く。
航空宇宙分野の主要ドキュメンテーションポータル6サイトを、AIエージェント対応性の観点から評価したところ、対応済みのサイトは0件だった。評価はAFDocs仕様(オープンソースのチェックリスト)に基づき、llms.txtの有無、robots.txt、URLバリアント対応などの基準で採点。最高スコアはICAOの69点(100点満点)で、いずれのサイトもAIエージェントによる効率的なデータ分析が不可能な状態にある。この結果は、航空宇宙分野における生産性向上の機会損失を示唆している。
Hacker Newsでの投稿者が、コーディング支援向けの大規模言語モデル(LLM)が将来、性能向上とコスト低下を同時に実現するかどうかを問いかけています。技術の進歩と市場競争により、精度向上と価格低下の両方が期待される一方で、そのペースや限界についてコミュニティ内で議論が交わされています。
ソフトウェア開発において、外部のツールや人材に「理解」を委託することは本質的に不可能だと論じる記事。コードレビューや設計判断を他者やAIに任せても、最終的な責任と深い理解は自分自身にしか持ち得ず、真の成果は自らの思考と判断によってのみ得られることを指摘している。
大規模言語モデル(LLM)は、学習データに偏った「集団思考(グループシンク)」に陥りやすく、多様な視点を生み出すのが難しいという課題がある。あるスタートアップは、LLMに異なる視点や議論を強制することで、より創造的でバランスの取れた出力を引き出そうとしている。この手法は、AIの思考の多様性を高める新たなアプローチとして注目されている。
Large language models have dominated the AI narrative, but their massive compute and energy demands make them unsustainable. Small Language Models (SLMs) offer a more efficient, accessible, and specialized alternative that can run on consumer hardware. The future of practical AI lies not in ever-larger models, but in lean, targeted systems designed for specific tasks and local deployment.
AIコンパス
1.0bambamramfan氏による政治コンパス風のクイズ「AI Compass」。AIとAI倫理に関する29の質問に答えると、30のアーキタイプのうち自分に最も合ったものが表示される。筆者が初回で分類されたのは「The Garage Tinkerer」(守護聖人はSimon Willison本人)。Reactの単一ページアプリとして実装されており、ビルド工程を省くため<script type="text/babel">のトリックを使用している。
世界モデルハーネス(world-model-harness)は、大規模言語モデル(LLM)を高速なサンドボックス環境として利用できるようにするオープンソースツールです。従来のシミュレーションと比較して最大5倍高速に動作し、AIエージェントの学習やテストを効率化します。このプロジェクトは、LLMを現実世界の代用モデルとして活用することで、より迅速なプロトタイピングと実験を可能にします。
人間にとって言葉は意識の副産物だが、大規模言語モデル(LLM)にとっては逆で、言葉のパターン学習を通じて擬似的な意識のような振る舞いが生じるという考察。意識と言語の関係を人間とAIで比較し、LLMの「思考」の本質を問い直す内容。
LLMs generate plausible-sounding but incorrect answers because they lack a true understanding of knowledge boundaries. Unlike humans who can say "I don't know," LLMs are designed to always produce a response, leading to confabulation rather than simple hallucination. This distinction matters for how we build trust in AI systems.
AIエージェントが職場に導入され「同僚」のように扱われる事例が増えているが、実際には彼らは人間の同僚とは根本的に異なる存在である。エージェントは自律的に行動するものの、説明責任や感情、判断力を持たず、人間のチームに真に溶け込むことはできない。職場でのAIの位置づけを再考する必要がある。
本稿は、経済史研究における大規模言語モデル(LLM)と生成AIの活用方法を体系的に解説する。具体的な使用例や注意点、データ処理・分析におけるベストプラクティスを示し、歴史データの解析や文献調査への応用可能性を探る。経済史分野の研究者がAI技術を効果的かつ倫理的に活用するための実践的ガイドラインを提供する。
大規模言語モデル(LLM)の普及により、学術会議や業界カンファレンスのプログラム構成が大きく変化している。投稿論文の増加や査読プロセスへのAI活用、そしてプログラム委員会の対応など、会議運営の現場で起きている具体的な変化と課題について分析する。
最近のHNのスレッドでは、LLMが信頼できないデータを出力すると指摘する声がある。そのため、新しい概念や難しいテーマを理解・学習するための情報源として、AIは適切ではないのではないか、という疑問が提起されている。
Jon Udell氏は「人間がループの中にいる(human in the loop)」という表現は機械に主権を委ねるものだと批判し、エージェントをチームに招き入れる形で、従来通りの人間主体のループを維持すべきだと主張する。エージェント支援プロセスは、プロンプトを受け取って機能を出力するブラックボックスであってはならないと論じている。
This article explores whether large language models (LLMs) can pass the mirror test—a classic measure of self-awareness in animals. The author examines how LLMs respond to questions about identity and reflection, highlighting the limitations and surprising behaviors observed in current AI systems.
本記事は、「Tokenmaxxing」という概念の変遷を考察する。かつてはトークン数を最大化することがAIエージェントの性能向上に不可欠とされたが、現在ではそのアプローチに限界が見え始めている。しかし、新しい形のTokenmaxxingが再定義されつつあり、エージェント技術とLLMの進化における重要な転換点を迎えている。
この投稿者は、現在の議会制度(高齢者による支配の愚かさ)よりもLLMの方が優れている可能性があり、技術はすでに十分な水準にあると主張している。