本地部署 Qwen3.6 35B MoE 模型实战
记录在消费级硬件上使用 llama.cpp 部署 Qwen3.6-35B-A3B MoE 模型的完整过程,涵盖量化策略、内存优化与推理加速技巧。
探索人工智能、分布式系统与工程实践
记录在消费级硬件上使用 llama.cpp 部署 Qwen3.6-35B-A3B MoE 模型的完整过程,涵盖量化策略、内存优化与推理加速技巧。
Caddy 是一款自带自动 HTTPS 的现代 Web 服务器。本文对比了 Caddy 与 nginx、Traefik 在反向代理场景下的表现,并展示了完整 Caddyfile 配置。
Stanford 开源的 DSPy 框架将 LLM 调用抽象为声明式程序,通过编译器自动优化 prompt。本文解析其核心概念与 RAG 优化实战。
探索在 Mac 上利用 MLX 框架高效运行 Qwen3-TTS 0.6B 模型,实现自然语音合成。包含性能基准、内存占用和实际应用场景讨论。
在这个算法推荐泛滥的时代,用 Miniflux + PostgreSQL 搭建属于自己的 RSS 阅读器。覆盖 AI/ML、科技、金融三大领域的优质信源推荐。