本文介绍了 vLLM 中基于原生速度优化的 transformers 建模后端,展示了如何通过高效的内存管理和计算优化,显著提升大语言模型的推理速度与吞吐量。这一后端为部署高性能 LLM 服务提供了关键支持。
#performance
30 条相关内容
用Rust重写Bun
3.0Bun团队宣布正在将Bun运行时从Zig重写为Rust,以利用Rust更成熟的生态系统、更好的工具链支持和更广泛的开发者社区。这一迁移旨在提升性能、稳定性和可维护性,同时保持对现有JavaScript/TypeScript应用的完全兼容。
本文介绍了如何通过 OpenTofu 的 --exclude 标志,在基础设施即代码(IaC)工作流中有选择地跳过特定资源,从而快速定位和隔离性能瓶颈。通过排除非关键资源,团队能够缩短执行时间、提高调试效率,并更精确地分析 Terraform 状态中的问题区域。
PEP 836 提出了为 CPython 引入官方支持的即时(JIT)编译器的计划。该提案旨在通过逐步实现 JIT 编译来显著提升 CPython 的执行性能,同时保持与现有 Python 代码的兼容性。文档详细描述了方案的技术路线、性能目标以及实施阶段,为 CPython 未来的性能优化奠定了重要基础。
本文对40款主流CSS工具进行了性能与学习曲线的全面测试与对比,最终评选出综合表现最佳的优胜者。测试覆盖了工具的运行效率、上手难度、功能完整性等多个维度,为前端开发者在选择CSS工具时提供了清晰的参考依据与实用建议。
Manticore Search 重构了其 ONNX 嵌入处理路径,通过优化模型加载、内存管理和执行流程,实现了最高 14 倍的嵌入生成速度提升。文章详细介绍了从最初的原型设计到性能瓶颈分析,再到最终优化的技术决策过程,为使用 ONNX 进行向量搜索的应用提供了显著的性能优化参考。
本文探讨了在浏览器中处理大型GIS数据集(如1GB的GML文件)的挑战。作者分享了实际案例,分析了传统加载方式的性能瓶颈,并解释了为什么矢量切片技术是处理大规模地理空间数据的更优解决方案。文章还提供了优化大型数据集加载的实用建议和最佳实践。
JPEG-XL 参考实现库 libjxl 发布 0.12 版本,带来了更多的性能优化。新版本改进了编码和解码速度,特别是在多线程处理方面有显著提升,同时修复了多个 bug 并提高了图像质量。此次更新继续推动 JPEG-XL 作为一种高效、免版税的下一代图像格式。
Bifrost is an open-source enterprise AI gateway designed for high performance, offering the fastest inference and routing for AI models in production environments. It supports multiple AI providers, load balancing, and caching to reduce latency and cost.
本文深入探讨了面向对象编程(OOP)与实体组件系统(ECS)在内存布局和CPU缓存性能上的根本差异。作者通过JavaScript基准测试,分析了ECS如何通过改善数据局部性来减少缓存未命中,从而提升性能。文章不仅解释了ECS在游戏开发中的优势,还展示了即使在JavaScript这类高级语言中,内存访问模式依然对性能有显著影响。
ScyllaDB推出了基于字典树(Trie)的新型索引技术,相比传统索引方案,可将吞吐量提升多达3倍。该索引通过优化数据结构和内存访问模式,显著提高了查询性能和系统效率,适用于大规模分布式数据库场景。
本文介绍了 .NET 11 中进程 API 的一系列改进,包括增强的进程启动性能、新的进程信息查询功能以及更完善的进程生命周期管理。这些改进旨在提高开发者在处理系统进程时的效率与可靠性,尤其是在高并发和资源敏感型应用场景下。
CSS Containment(CSS 包含)是一项通过限制元素对其外部页面区域的影响来优化浏览器渲染性能的 CSS 规范。通过使用 contain 属性(包含 layout、style、paint 和 size 等值),开发者可以告知浏览器哪些元素的变更不会溢出其边界,从而避免代价高昂的全局重排和重绘。该文章深入介绍了每种包含类型的作用、实际应用场景以及如何在不破坏布局的前提下安全地应用它们来提升页面性能。
本文探讨了如何优化一个在设计上就具有二次复杂度的算法。作者分析了算法复杂度固有的局限性,并提出了在不改变核心设计的前提下,通过改进实现细节、利用缓存和提前终止等策略来提升实际性能的方法。文章展示了即使面对理论上的复杂度限制,仍可通过工程手段获得显著的性能提升。
Pgblame 是一款开源工具,能够将 Postgres 数据库的性能问题追溯到具体的代码部署,尤其适用于 Vercel 环境。它通过分析查询性能的变化,帮助开发者快速定位是哪个部署版本导致了数据库变慢,从而加速问题排查与修复流程。
当文件大小超过可用内存时,无法直接将整个文件读入内存处理。本文介绍了分块读取、流式处理、内存映射文件等高效处理大型文件的策略,帮助开发者避免内存溢出错误,同时保持代码的清晰与可维护性。
Ferroload 是一个基于 Rust 编写的高性能数据加载器,旨在提供比传统 Python 数据加载方案更快的加载速度。它利用 Rust 的内存安全性和并发特性,在保持易用性的同时显著提升数据加载性能,适用于需要高效数据处理的工作流。
该项目实现了一个Go语言编写的进程间通信(IPC)机制,通过完全避免系统调用来实现超高性能,达到了每秒1800万次事务处理(TPS)的惊人吞吐量。它专为解决数据库插入速度瓶颈而设计,展示了在特定场景下通过底层优化可以实现的极致性能提升。
本文探讨了“95%分位”这一常见基准的局限性。作者指出,在许多现实场景(如工程、体育、商业)中,处于95%分位远非顶尖,因为顶部5%的人群之间仍存在巨大差异。通过多个案例分析,文章说明真正的卓越往往需要在极端分位上持续精进,而非满足于前5%的排名。
本文介绍了如何利用 Clipper 工具对 BuildKit 进行性能分析,从而将 Docker 镜像构建速度最高提升 7 倍。通过识别构建过程中的瓶颈并优化缓存使用、并行化步骤等策略,Clipper 帮助开发团队显著缩短 CI/CD 流水线中的镜像构建时间,提升整体开发效率。
fastcp 是一个基于 Rust / Bash 的 cp 封装工具,它会检测文件系统是否支持 reflink(引用链接),如果支持则自动追加 --reflink=always 参数,从而让 cp 复制操作更快。适用于支持 reflink 的文件系统(如 Btrfs、XFS 等)。
本文深入探讨了GitHub团队在优化代码差异(diff)行渲染性能过程中遇到的技术挑战与解决方案。文章详细分析了从最初的设计决策到最终的性能调优,包括减少DOM节点数量、优化差分算法以及利用虚拟滚动等技术手段,最终显著提升了大规模差异文件的加载与交互性能。这是一个关于在前端性能优化领域持续迭代、克服瓶颈的真实案例。
本文深入分析了 Codex 系统中 SQLite 数据库每年高达 640TB 的惊人写入量。通过对写入模式、数据流和存储策略的追踪,文章揭示了这一大规模写入背后的技术原因、潜在瓶颈以及优化方向,为高吞吐量数据库管理提供了宝贵的参考案例。
本文探讨了 Rust 服务中常见的内存泄漏误判问题。作者指出,当 Rust 服务的内存占用持续增长时,开发者往往首先怀疑代码泄漏,但真正原因可能在于内存分配器(allocator)的行为差异。文章通过具体案例分析了不同分配器(如 jemalloc、glibc malloc 等)在内存管理策略上的区别,以及它们如何影响进程的实际内存占用。理解这些机制有助于开发者更准确地诊断性能问题,避免在不必要的地方浪费调试时间。
高性能 Swift 应用
2.0本文探讨了构建高性能 Swift 应用的关键技术和最佳实践,涵盖内存管理、并发编程、算法优化等方面,帮助开发者显著提升应用的运行效率和响应速度。
This article describes the experience of rewriting tinygrad, a lightweight machine learning framework, in the Lean programming language. The authors discuss the motivations behind the rewrite, focusing on performance improvements and leveraging Lean's strengths for formal verification and efficient code. They claim the new version is faster than the original Python implementation, highlighting specific optimizations and the trade-offs involved.
本文详细介绍了在 AMD Threadripper 9980X 处理器上对 Hardwood 1.0 进行的性能基准测试。文章涵盖了测试环境配置、关键性能指标以及不同工作负载下的表现分析,为在高性能计算场景中评估 Hardwood 1.0 提供了参考数据。
太多表对你有害
1.5在数据库设计中,创建过多的表会显著影响性能和维护性。本文探讨了过度表分化(table proliferation)带来的问题,包括查询性能下降、连接操作变慢、内存管理效率降低以及开发复杂性增加。作者通过实际案例和性能基准测试,展示了表数量过多如何导致计划优化器负担加重、缓存命中率下降以及维护工作成倍增长,并提出了合理的表设计建议来避免这些陷阱。
本文深入剖析了 CockroachDB 中密码重置流程性能缓慢的根本原因。作者通过系统化的优化方法,逐步定位并解决了数据库查询、索引设计及数据分布等方面的问题,最终显著提升了密码重置操作的执行效率。这篇文章是 CockroachDB 性能优化的实战案例,对于理解分布式数据库的调优技巧具有参考价值。
时序数据库专为处理按时间排序的数据(如监控指标、传感器读数等)而设计,通过LSM树、列式存储和时间分区等机制实现高效的写入和查询性能。然而,当面临高基数数据(如大量唯一标签组合)或复杂连接查询时,传统时序数据库会因索引膨胀、预聚合开销过大等问题出现性能瓶颈。本文深入剖析了时序数据库的底层工作方式,并揭示了其在实际应用中容易失效的场景。