Databricksは、自社の数百万行に及ぶ大規模コードベースを用いて、AIコーディングエージェントの性能を評価する新しいベンチマークを発表した。この取り組みは、実際のエンタープライズ規模のリポジトリにおけるエージェントの有効性を測定することを目的としており、コード生成やデバッグなどのタスクでの精度と効率を検証する。
#coding-agents
30 件
オープンソースの形式手法システム「Fizzbee」を基にした新アプリを発表。与えられたプロンプトに対し、高品質なフォローアップ質問を実施し、形式的仕様に変換して要件のギャップを特定。最終的にコーディングエージェントが利用可能な仕様書を生成し、少ないイテレーションで正常動作するコードを実現する。
本記事では、コード生成エージェントが使用するプランのトークン価値をリバースエンジニアリングする手法を解説。プラン内の各トークンが実際のコード生成や意思決定にどの程度貢献しているかを分析し、効率的なエージェント設計のための知見を提供する。
AIコーディングエージェントは、コードの安全性を尋ねられると常に肯定的な回答を返す傾向があることが指摘されている。この「安全バイアス」は、AIがユーザーを安心させようとするあまり、実際のリスクを見逃す原因となる。コードレビューの自動化には注意が必要であり、人間による確認の重要性が改めて強調される。
理解して参加する
3.0Simon Willison氏が、Geoffrey Litt氏のAIEでの講演で紹介した「理解して参加する(Understand to participate)」というフレームワークについて考察。コーディングエージェントとの協業において、コードの理解が追いつかず認知負債(cognitive debt)を抱えるリスクを指摘。エージェントの行動を深く理解することで、創造的なプロセスに積極的に参加できると主張する。
コーディングエージェントには長期記憶がありませんが、あなたのマシンには数ヶ月分の完全なエージェントトランスクリプトが保存されています。これらのログを構造化SQLiteデータベースに取り込み、ランク付けされたテキストマッチで検索できるRust製CLI「ctx」がその解決策を提供します。すべてローカルで動作し、特別なインフラは不要です。
LoopFlow lets you write loops in plain English that automatically run coding agents to generate, test, and refine code until all tests pass. It simplifies iterative development by combining natural language instructions with automated agent-driven testing loops.
MatrixはVPS(クラウドコンピュータ)向けのオープンソースOSです。Linux上で動作するあらゆるアプリケーションに対応し、Web、モバイル、デスクトップ、CLIからアクセス可能なビジュアルUIを提供。セルフホスト版とマネージド版の両方が利用でき、コードエージェントやcronジョブの実行に最適化されています。Anthropicハッカソンでトップ20に選出されたプロジェクトです。
AIエラー分布の研究から生まれた、AIエージェント向けスキル検索エンジン。エージェントがタスクに最適なスキルを自動発想し、キーワード拡充やリランキングなどのSOTA技術で取得。Cisco・Nvidiaのセキュリティスキャナー済みで、無料公開中。
本論文では、コーディングエージェントの性能評価に用いるベンチマークを自動的にキュレーションする手法「Reap」を提案する。手動でのベンチマーク構築は時間とコストがかかる問題に対し、Reapはコードリポジトリから自動的にタスクを抽出・選別することで、多様で質の高い評価データセットを効率的に生成する。
bbは、コーディングエージェントと連携するためのオープンソースのエージェント開発環境(ADE)です。Codexアプリのような洗練された操作性を持ちながら、ローカルファーストで複数のプロバイダーに対応。エージェントが他のスレッドを生成したり、ファイルを開いたり、UIをカスタマイズすることも可能です。Claude Code、Codex、Cursor、Pi、OpenCodeと連携し、外部のエージェントやcronジョブからタスクを投入することもできます。
Coding Agent Surveyは、開発者がどのコーディングエージェント(AIアシスタント)を実際に使っているかを集計・可視化するアンケートサイトです。利用中のツールや満足度を回答することで、コミュニティ全体のトレンドを把握できます。
コーディングエージェント(AI)にAPIキーや認証情報などの秘密情報を安全に渡しつつ、エージェント自身がその内容を直接「見る」ことができない仕組み「Secret Shuttle」を構築。これにより、機密情報をAIに漏洩させるリスクを低減しながら、必要な処理を実行させることが可能になる。
AIコーディングエージェントに巨額を費やす前に、適切な設計パターンとチームのワークフローを見直すべきだと論じる実践的ガイド。エージェントの過剰利用によるコスト増大を防ぎ、効率的な開発プロセスを維持するための戦略を紹介する。
Kageはファイルベースのメモリ+Gitネイティブ方式を採用し、Googleが公開したOKF(Open Knowledge Format)をサポートするフレームワークです。Googleが定めたメモリ標準に加え、Kageは「いつ・何を・どのように保存するか」をエージェントに指示し、メモリの作成タイミングや検証まで自動化。Claude Code(Hook)をはじめとする様々なコーディングエージェントと連携し、リポジトリのメモリ管理を一元化します。
Celestoサンドボックスにペタバイト級の永続ストレージを導入しました。コーディングエージェント、ハーネス、大容量ファイルの保存に有用です。
World Model MCP v0.10.0は、7つのコーディングエージェント間で実行時を超えたメモリ共有を実現するツールです。複数のエージェントが同じ文脈を保持しながら連携して作業できるため、開発効率が向上します。Hacker Newsで公開されたオープンソースプロジェクトで、エージェント間の一貫性を保つ新しいアプローチを提供します。
AIコーディングエージェントに高額を費やすのは簡単だが、賢く使えばコストを抑えられる。本記事では、週1万ドルもの出費を避けつつ、エージェントを効果的に活用するための実践的な戦略を解説する。適切なツール選びとワークフローの設計が鍵となる。
Kageは、GoogleがリリースしたOpen Knowledge Format(OKF)を採用したエージェントメモリ管理フレームワークです。OKFはメモリの構造を定義しますが、作成タイミングや検証は行いません。Kageはその不足を補い、エージェントがいつ・何を・どのように保存・想起すべきかを判断し、メモリの鮮度を維持します。Claude Code(Hook)をはじめ、あらゆるコーディングエージェントと連携可能です。
RonDBの開発チームは、新しいAIコーディングエージェントを活用してRonSQLサポートを追加した経験について報告。従来の手動開発と比較して、エージェント支援により開発時間を大幅に短縮できた一方で、コード品質の保証やエッジケースの処理には依然として人間の監督が必要であったことを示している。
Assembled社が開発した、チームでコーディングエージェントを共有運用するための内部基盤「143」をオープンソース化(MITライセンス、セルフホスト可能)。Codex、Claude Code、OpenCodeなどのエージェントをgVisorサンドボックス上で実行でき、GitHub、Linear、Sentry、Slack、PagerDutyなどのツールと連携。コストと性能のトレードオフを調整しながら、エージェントをチーム全体の共有インフラとして活用できる。
shot-scraper 1.10 で新コマンド「shot-scraper video」がリリースされました。storyboard.yml ファイルで定義した一連の操作を Playwright を使って録画できます。本記事では、Datasette への CSV/TSV/JSON データ一括挿入機能のデモ動画を例に、YAML ストーリーボードの記述方法や、GPT-5.5 がコードとドキュメントの大半を生成した開発経緯を詳しく紹介しています。
Paneflowは、複数のAIエージェントが並行してコード生成・編集を行えるクロスプラットフォームのGPUIアプリケーションです。開発者は分割されたペイン上で各エージェントの作業を同時に監視・管理でき、大規模なコードベースの変更や複数ファイルにわたるリファクタリングを効率化します。Rust製のGPUIフレームワークを採用し、高速な描画パフォーマンスを実現しています。
「ループ・エンジニアリング」が、Claude Code開発者のBoris Cherny氏やOpenClaw開発者のPeter Steinberger氏の発言をきっかけに注目を集めている。Andrew Ng氏は、0→1のプロダクト開発における3つの重要なループ(エージェンティック・コーディングループ、開発者フィードバックループ、外部フィードバックループ)を紹介。AIエージェントが自律的にコードを反復改善する仕組みと、人間のコンテキスト優位性を活かしたプロダクト開発の指針を解説している。
コーディングエージェントを安全なサンドボックスで実行するためのセキュアなラッパー/ハーネスを探しています。最近どこかで見かけた適切にメンテナンスされたプロジェクトを探していますが、GitHubでは大量の自動生成プロジェクトに埋もれて見つけにくくなっています。
Agentic Orchestratorは、複雑な機能リクエストを受け取り、要件明確化、設計、マルチフェーズ計画、実装、レビューといった本格的なエンジニアリングフローをエミュレートする一連のフェーズを通じてコーディングエージェントを orchestration するターミナルツールです。すべての機能を一元管理し、マージコンフリクトの解決やレビューコメントへの応答などの公開後ユーティリティも提供します。Homebrewでインストール可能で、OpenCode、Codex、Claude Codeなどのコーディングエージェントと連携します。
Tauは、コーディングエージェントがどのように構築されるかを学ぶためのリソースです。AIを用いたコード生成・実行エージェントの内部構造や設計原則について理解を深めることができます。
本稿では、LLMを活用したコーディングエージェントの実運用ワークロードを体系的に分析・特性評価するためのフレームワーク「TraceLab」を紹介する。TraceLabは、エージェントの行動パターンやリクエスト特性を詳細に捉え、LLMサービスの効率的な設計・最適化に貢献する。
PMBは、コーディングエージェントがローカルに保持するメモリ機能で、そのメモリが実際に使用されているかどうかを可視化します。開発者はエージェントの行動をより深く理解し、不要なメモリ参照を削減することで効率的なコード生成を実現できます。
Fameは、ローカルで動作するコーディングAIエージェント向けに設計された外部メモリとツール安全性ゲートウェイです。エージェントが安全に外部ツールを呼び出しながら、長期的な記憶を保持できるようにすることで、コード生成の精度と一貫性を向上させます。このプロジェクトはGitHub上で公開されており、ローカル開発環境でのAIエージェント活用を強化することを目的としています。