A study reveals that certain patterns initially drawn in untrained neural networks persist even after extensive training. These "skeletons" influence the network's final behavior, challenging the view that training completely overwrites initial structures. The findings suggest innate network architectures play a larger role in learning outcomes than previously thought.
#machine-learning
30 件
FindGenre.comは、スペクトログラム(音声の視覚表現)で訓練されたCNN(畳み込みニューラルネットワーク)を用いて、音楽トラックのジャンルを自動判定するツールです。音声ファイルをアップロードするだけで、AIが分析し、予測されたジャンルを表示します。
This blog post argues that Fable, despite its popularity, lacks practical utility as a computational model. The author critiques its assumptions, limitations, and failure to generalize to real-world scenarios, concluding that researchers should seek more robust alternatives.
Grok 4.5
8.0xAIがGrok 4.5を発表。最新の大規模言語モデルであり、推論能力、コーディング性能、マルチモーダル理解が大幅に向上。前モデルから一貫して改善を続けており、より高度な会話エージェントとしての進化を示す。
ポール・グレアム氏が、FableがGPT-3から大幅に進歩したように、5年後にはさらに優れたモデルが登場する可能性について言及。ジャレッド・フリードマン氏もFableの優秀さを絶賛している。AIの急速な進化を予感させる一言。
JAXを使用してGPT-2 Smallサイズの言語モデルをゼロから段階的に構築・訓練する詳細ガイド。バイグラムモデルから始め、トークン埋め込み、位置エンコーディング、マルチヘッド自己注意機構、順伝播層、層正規化を順に追加し、完全なTransformerを実現する。
Grok 4.5
5.0This blog post introduces the latest version of Cursor's AI model, Grok 4.5, highlighting its improved reasoning capabilities and performance enhancements for code generation and debugging tasks.
この動画では、機械学習におけるベクトル埋め込みの数学的基礎を解説。高次元データを低次元ベクトル空間に変換し、意味的類似性を捉える方法を紹介する。コサイン類似度や内積などの基本概念を用いて、埋め込みがどのように単語や画像の関係性を表現するかを学ぶ。
AIにおける真の課題はモデルそのものではなく、データの質、人間のフィードバックの収集、そして実運用環境でのシステム統合にある。モデルの性能向上が進むほど、これらの周辺要素の重要性が増している。
コンテキスト情報検索
1.0本稿では、文脈を考慮した情報検索(Contextual Information Retrieval)の概念と手法について解説する。従来のキーワードベースの検索とは異なり、ユーザーの検索意図や周辺情報を活用することで、より精度の高い検索結果を提供するアプローチを紹介している。
この動画は、人工知能がどのようにして人間の言語を理解し、話す能力を獲得したのかを解説する。初期のルールベースのシステムから、ディープラーニングによる大規模言語モデルの登場まで、AIの言語処理技術の進化をわかりやすく紹介する。
本記事では、機械学習を用いて金融分野における専門家の判断を再現する手法について解説する。従来は人間の専門家に依存していた複雑な金融判断タスクを、AIモデルが学習・模倣することで、効率性と一貫性を向上させる可能性を探る。具体的なケーススタディを通じて、モデルの構築方法や実装上の課題、精度評価のポイントを紹介する。
因果推論入門
2.0本稿は、因果推論の基礎を初学者向けに解説した講義ノートである。確率的因果モデル、介入、反事実、有向非巡回グラフ(DAG)といった中核的概念をカバーし、観察データから因果関係を推定するための手法を体系的に紹介する。
このガイドでは、Jamesobが最新の大規模言語モデル(LLM)をローカル環境で実行するための手順を解説しています。セットアップからモデルの選択、実行に必要なツールやリソースまで、実践的なアドバイスを提供します。
This project introduces "Egregore," an AI system that models latent space as overlapping manifolds, enabling more nuanced and interconnected representations of data. The approach allows for complex relationships and emergent behaviors within the AI's internal representations, moving beyond traditional linear or isolated latent space models.
Mistral AIが「Leanstral 1.5」を発表。これは、Lean定理証明器とMistralの大規模言語モデルを組み合わせ、形式検証や数学的推論における証明の生成を促進するツール。証明の「豊かさ(abundance)」を民主化し、研究者や開発者がより簡単に厳密な証明を構築できるよう支援する。
検証可能領域を超えた強化学習(RL)の応用について探求する。伝統的に検証可能なタスクに限定されがちだったRLの適用範囲を拡張し、客観的な報酬関数が定義しにくい領域での学習手法を考察する。
本論文では、分散型マルチエージェントシステムにおける協調問題を解決する新しいフレームワーク「Sheaf-ADMM」を提案する。シーフ(層)理論とADMM(交互方向乗数法)を組み合わせることで、エージェント間の複雑な相互作用を効率的にモデル化し、従来手法よりも高速かつ安定した収束を実現する。
RunInfra.aiは、ユーザーが独自のAIモデルを構築・デプロイできるプラットフォームです。インフラ管理の複雑さを排除し、モデル開発に集中できる環境を提供します。
本論文では、ニューラルネットワークのアテンションメカニズムを解釈するための新しい手法として、プログラム合成を活用したアプローチを提案する。アテンションの動作原理を人間が理解可能なプログラムとして抽出することで、モデルの判断根拠を明確に説明できるようにする。
AIによる予測能力が人間のスーパーフォーキャスター(超予測者)に迫りつつある現状を分析。大規模言語モデルを用いた予測システムが、地政学的イベントや経済指標などの将来予測で高い精度を達成しており、従来の専門家の判断を上回るケースも出てきている。AI予測の可能性と限界について詳しく検討する。
NX-AI/TiRex-2は、タイムシリーズ(TS)の基盤モデルであり、時系列データの分析と予測に特化したAIモデルです。このモデルは様々な時系列タスクに対して汎用的に利用できるよう設計されており、Hugging Face上で公開されています。
本動画では、AIモデルに新しい能力を学習させるために必要なデータの質と構成について解説。適切な「データレシピ」がなければ、どれだけ高度なアルゴリズムを使っても望む結果は得られないと指摘し、データの選別、ラベリング、バランス調整など実践的な手法を紹介する。
モデルルーティングとは、タスクの特性に応じて最適なAIモデルを自動選択する手法。本稿では、その基本原理を「コスト・精度・レイテンシのトレードオフ」として整理し、ルーター設計における実践的アプローチを解説する。
This project introduces a novel approach to large language model optimization that shifts focus from training the model itself to evolving the "harness" — the surrounding infrastructure and prompt strategies. By optimizing the harness rather than model weights, the method achieves significant performance improvements with minimal computational cost, offering a practical alternative to traditional fine-tuning approaches for LLM enhancement.
128GBメモリを搭載したM4 Max Mac Studio向けの、最適なローカルLLM(大規模言語モデル)セットアップについて議論するスレッド。ユーザーは、モデルの選定(Llama、Mistral、Qwenなど)、量子化レベル、推論フレームワーク(llama.cpp、MLX、Ollamaなど)、およびメモリ帯域幅とパフォーマンスのバランスについて実践的なアドバイスを共有している。
Data Science Weekly Issue 658の最新号が公開されました。今週もデータサイエンス、機械学習、AI分野の注目記事やチュートリアル、リソースを厳選してお届けします。
This article discusses how machine learning models can be trained to replicate expert judgment in financial tasks, reducing reliance on human experts while maintaining decision quality. The approach uses supervised learning on historical expert decisions to build models that can evaluate credit risk, detect fraud, and make investment recommendations with accuracy comparable to human specialists.
AI研究論文の氾濫についていけず、1本30〜60分かかる読書が難しい問題を解決するため、Gist Discoverを開発。各論文は「要旨」「論理展開」「反論」「鋼鉄化反論」の4層構造のスライドデッキで表示され、約10秒で概要を把握可能。TTS音声対応、IDE拡張機能も提供。データセット作成に13万ドルのClaudeクレジットを投入し、専用にファインチューニングしたモデルを搭載。arXix論文のフィードを無料で公開中(サインアップ不要)。
わずか155Kパラメータという超軽量Transformerモデルが、学習データに含まれていない未知の世界の内部表現(地図)を自律的に構築する現象を紹介。モデルの極小サイズにもかかわらず、空間的な構造を学習し、未踏の環境を推論できることを示す。