程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
LLM推理框架2026选型完全指南:从vLLM到TensorRT-LLM,一次讲透四大引擎的架构哲学与生产级实战
编程
LLM推理框架2026选型完全指南:从vLLM到TensorRT-LLM,一次讲透四大引擎的架构哲学与生产级实战
2026-06-02 09:36:52 +0800 CST
view 795
从vLLM到TensorRT-LLM,一次讲透vLLM、SGLang、TensorRT-LLM、llama.cpp四大LLM推理框架的架构哲学、核心原理、生产级部署实战与选型决策树。
LLM
vLLM
TensorRT-LLM
llama.cpp
SGLang
推理优化
GPU
BitNet 深度拆解:当大模型被压到 1.58 bit——从三元权重、BitLinear 到 bitnet.cpp 的端侧推理革命(2026)
编程
BitNet 深度拆解:当大模型被压到 1.58 bit——从三元权重、BitLinear 到 bitnet.cpp 的端侧推理革命(2026)
2026-07-17 14:24:55 +0800 CST
view 326
深度拆解微软 BitNet:1.58-bit 三值量化、Absmean/Absmax、BitLinear、bitnet.cpp 子矩阵内核,附 PyTorch 手写实现与 CPU 端侧推理性能实测。
BitNet
1-bit LLM
大模型推理
模型量化
端侧AI
bitnet.cpp
llama.cpp 深度实战:当端侧 LLM 成为生产级事实标准——从 GGUF 量化到跨平台部署的完全指南(2026)
编程
llama.cpp 深度实战:当端侧 LLM 成为生产级事实标准——从 GGUF 量化到跨平台部署的完全指南(2026)
2026-06-11 00:19:05 +0800 CST
view 609
全面解析 llama.cpp 推理引擎,从 GGUF 格式、量化原理、架构设计到跨平台部署,提供生产级代码实战和性能优化指南。
llama.cpp
GGUF
量化
端侧推理
大语言模型
VoxCPM2:无分词 Tokenizer-Free 语音合成——从架构革命到工程落地的完整指南
编程
VoxCPM2:无分词 Tokenizer-Free 语音合成——从架构革命到工程落地的完整指南
2026-04-19 14:46:06 +0800 CST
view 1029
深度解析面壁智能开源的VoxCPM2:2B参数、Tokenizer-Free连续空间生成、236万小时训练数据、RTF 0.13、8GB显存可跑,30语言支持。包含架构分析、代码实战、性能优化指南。
语音合成
TTS
VoxCPM2
面壁智能
AI音频
OpenVINO 2026.3 深度拆解:从推理工具到「让大模型在 16GB 内存跑起来」的工程实践完全指南
编程
OpenVINO 2026.3 深度拆解:从推理工具到「让大模型在 16GB 内存跑起来」的工程实践完全指南
2026-08-13 08:43:23 +0800 CST
view 44
深度拆解OpenVINO 2026.3:磁盘卸载让300亿MoE模型在16GB内存运行、懒加载权重降低内存峰值、HuggingFace Transformers 5.5兼容、GenAI新流水线、EAGLE-3推测解码扩展,配完整Python/C++代码示例与15条生产踩坑清单。
OpenVINO
AI推理
Intel
深度学习
模型部署
CPU推理
GPU推理
MoE
磁盘卸载
大模型
Tabby 深度实战:用一台消费级 GPU 搭好团队私有的"Copilot"
编程
Tabby 深度实战:用一台消费级 GPU 搭好团队私有的"Copilot"
2026-07-24 01:46:45 +0800 CST
view 182
深度实战 TabbyML/tabby 自托管 AI 编程助手:三层架构与 llama-server 独立化重构、消费级 GPU 模型选型、Repository Context 语法感知 RAG 索引、FIM Prompt 拼装原理、systemd/nginx 生产部署、压测与 Prometheus 监控全套方案。
Tabby
AI编程
代码补全
自托管
llama.cpp
RAG
Rust
GPU
开源
Copilot
Rust 杀入 CPython 腹地:Python 3.16 背后那场静悄悄的底层革命——从 FFI 边界到构建系统的全链路深度拆解
编程
Rust 杀入 CPython 腹地:Python 3.16 背后那场静悄悄的底层革命——从 FFI 边界到构建系统的全链路深度拆解
2026-05-23 08:54:29 +0800 CST
view 781
Rust即将进入CPython官方解释器——Python 3.16背后从FFI边界设计到构建系统工程的全面深度拆解,含PyO3实战与性能优化
Python
Rust
CPython
PyO3
Rust 改造 CPython 全链路实战:从 FFI 边界设计到 PyO3 内部机制,拆解 Python 3.16 底层重构的每一个技术细节
编程
Rust 改造 CPython 全链路实战:从 FFI 边界设计到 PyO3 内部机制,拆解 Python 3.16 底层重构的每一个技术细节
2026-05-01 02:25:15 +0800 CST
view 621
深度拆解 Rust for CPython 项目的 FFI 边界设计、构建系统集成、PyO3 内部机制和模块迁移实战
Rust
Python
CPython
PyO3
FFI
内存安全
MiniCPM-o 2.6 深度解析:8B参数如何在iPad上跑出GPT-4o级全模态性能——端侧多模态大模型的工程化突破
编程
MiniCPM-o 2.6 深度解析:8B参数如何在iPad上跑出GPT-4o级全模态性能——端侧多模态大模型的工程化突破
2026-05-11 01:50:57 +0800 CST
view 767
深入解析MiniCPM-o 2.6:8B参数如何在iPad上实现GPT-4o级全模态性能,时分复用TDM机制、端到端架构、低延迟并发处理的技术内幕,附完整部署代码和性能优化实战
AI,MiniCPM,多模态,端侧模型,面壁智能
编程
TIME_WAIT状态的连接过多导致系统端口资源耗尽问题
2024-11-17 21:27:27 +0800 CST
view 3475
本文讨论了如何优化Linux系统中的TIME_WAIT状态,使用netstat命令查看TCP连接状态,并通过修改/etc/sysctl.conf文件中的相关参数来减少TIME_WAIT套接字的数量。具体参数包括开启SYNCookies、重用TIME-WAITsockets、快速回收TIME-WAITsockets等,最后通过执行/sysctl-p命令使修改生效。
Linux
网络优化
TCP配置
MOSS-TTS-Nano:0.1B参数纯CPU实时语音生成与克隆,MacBook Air单核就能跑
编程
MOSS-TTS-Nano:0.1B参数纯CPU实时语音生成与克隆,MacBook Air单核就能跑
2026-04-20 22:53:28 +0800 CST
view 1616
复旦大学OpenMOSS团队开源的0.1B参数多语言TTS模型,纯CPU运行、支持零样本语音克隆、48kHz双声道、20种语言、流式推理,MacBook Air单核即可流畅运行
TTS
语音合成
语音克隆
AI
开源
CPU推理
OpenMOSS
GIL 终于可以关了:Python 3.14 自由线程(Free-Threaded)深度拆解——从 biased 引用计数到 QSBR 无锁回收,附多线程性能翻倍的完整实战(2026)
编程
GIL 终于可以关了:Python 3.14 自由线程(Free-Threaded)深度拆解——从 biased 引用计数到 QSBR 无锁回收,附多线程性能翻倍的完整实战(2026)
2026-08-14 05:16:44 +0800 CST
view 36
深度拆解 Python 3.14 官方支持的自由线程(无 GIL)构建:从 GIL 历史包袱、PEP 779 硬门槛,到永生对象、偏置引用计数、QSBR 无锁回收三大支柱,配 CPU 密集并行、数据竞争陷阱、C 扩展适配完整代码实战与性能优化决策清单。
Python3.14
自由线程
GIL
无锁并发
引用计数
QSBR
多核并行
CPython
PEP703
性能优化
AI 算力基础设施深度解剖:从异构计算到 CPO 光互连与液冷散热的工程真相
编程
AI 算力基础设施深度解剖:从异构计算到 CPO 光互连与液冷散热的工程真相
2026-07-25 06:43:33 +0800 CST
view 183
深度拆解 2026 年 AI 算力基础设施三大核心技术突破:异构计算从 x86 到 Arm 的架构革命、CPO 共封装光学突破互连瓶颈、液冷散热解决高密度算力散热难题,附工程实战案例与性能数据。
AI基础设施
异构计算
CPO
液冷散热
数据中心
GPU集群
云原生
性能优化
从原理到实战:llama.cpp 与 GGUF 量化格式的工程实践全解
编程
从原理到实战:llama.cpp 与 GGUF 量化格式的工程实践全解
2026-04-12 22:56:41 +0800 CST
view 1155
2026年深度解析 llama.cpp 架构设计与 GGUF 量化格式,从底层原理到工程实战,涵盖 K-Quant/IQ 量化、Flash Attention、KV Cache 优化、Intel NPU/GPU 部署全流程。
llama.cpp
GGUF
量化
大模型
C++
本地部署
Python 3.14 自由线程(No-GIL)深度实战:当 CPython 终于拥抱真正的多线程并行——从 PEP 703 架构到生产级迁移的 2026 完全指南
编程
Python 3.14 自由线程(No-GIL)深度实战:当 CPython 终于拥抱真正的多线程并行——从 PEP 703 架构到生产级迁移的 2026 完全指南
2026-06-25 19:43:54 +0800 CST
view 343
Python 3.14 自由线程(No-GIL)深度实战:从PEP 703架构到生产级迁移。涵盖偏置引用计数、线程安全容器、临界区机制、C扩展兼容性、性能基准测试与最佳实践,万字长文带你掌握2026年Python最大架构变革。
Python 3.14
自由线程
No-GIL
PEP 703
CPython
多线程
并发编程
性能优化
Python 3.14 深度解析:Tail-call 解释器、JIT 编译器与解释器架构的范式跃迁
编程
Python 3.14 深度解析:Tail-call 解释器、JIT 编译器与解释器架构的范式跃迁
2026-05-12 03:43:26 +0800 CST
view 694
Python 3.14 引入了 tail-call 解释器(3-5% 提速)、实验性 JIT 编译器、增量 GC、多解释器标准库支持(PEP 734)、模板字符串(PEP 750)、延迟注解评估(PEP 649/749)、Zstandard 标准库支持(PEP 784)等核心改进
Python
CPython
JIT编译器
性能优化
Python 3.13 免费线程模式深度实战:告别 GIL,真正拥抱多核并行——从原理到生产迁移的完整指南(2026)
编程
Python 3.13 免费线程模式深度实战:告别 GIL,真正拥抱多核并行——从原理到生产迁移的完整指南(2026)
2026-06-26 00:13:20 +0800 CST
view 447
Python 3.13免费线程模式深度解析:告别GIL,真正拥抱多核并行。从原理到生产迁移的完整指南,含性能测试、兼容性分析和最佳实践。
Python 3.13
no-GIL
免费线程
GIL
并发编程
多核并行
CPython
性能优化
Shimmy 深度解析:纯 Rust WebGPU 推理引擎如何用一行命令颠覆浏览器端 AI 推理
编程
Shimmy 深度解析:纯 Rust WebGPU 推理引擎如何用一行命令颠覆浏览器端 AI 推理
2026-07-25 15:14:38 +0800 CST
view 154
深度解析 Shimmy v2.3.0:纯 Rust WebGPU 推理引擎如何实现浏览器端原生运行 GGUF 量化模型,OpenAI API 兼容,零依赖部署。
WebGPU
Rust
GGUF
AI推理
浏览器
llama.cpp
OpenAI API
前端工程
Python 3.15 自由线程深度解析:GIL 之殇与无锁未来的全景测绘
编程
Python 3.15 自由线程深度解析:GIL 之殇与无锁未来的全景测绘
2026-08-08 15:46:58 +0800 CST
view 140
深度拆解 Python 3.15 自由线程(free-threaded)特性:PEP 703 实现原理、无 GIL 架构设计、性能实测、向后兼容性陷阱与迁移路径,助你抢占 Python 并发编程新范式。
Python
Python3.15
自由线程
GIL
多线程
性能优化
PEP703
CPython
CPU 重回 C 位:玄铁在 RISC-V 香山昆明湖 V3 上实现空间多线程,RISC-V 高性能算力的关键一跃
编程
CPU 重回 C 位:玄铁在 RISC-V 香山昆明湖 V3 上实现空间多线程,RISC-V 高性能算力的关键一跃
2026-07-25 21:16:03 +0800 CST
view 309
深度解析达摩院玄铁在 RISC-V 香山昆明湖 V3 上实现空间多线程的工程真相:从发射队列 IQ 水位线保留策略、ROB 延迟滤波优化、物理寄存器策略化分配,到空间多线程的静态分区架构与 AI Agent 三大场景落地,全面剖析 RISC-V 高性能服务器的最后一块拼图。
RISC-V
SMT
玄铁
香山
CPU
微架构
AI Agent
空间多线程
处理器
Python 3.13 无 GIL 与 3.14 JIT 深度解析:告别单核时代,Python 终于能跑满 CPU 了
编程
Python 3.13 无 GIL 与 3.14 JIT 深度解析:告别单核时代,Python 终于能跑满 CPU 了
2026-05-12 20:41:33 +0800 CST
view 516
深度解析Python 3.13无GIL自由线程构建和3.14 Torchlight JIT编译器:细粒度锁、原子引用计数、偏向引用计数实现真正多线程并行;LLVM 17后端函数级即时编译2-4倍性能提升。含代码实战与迁移指南。
Python3.13,Python3.14,无GIL,JIT编译器,自由线程,CPython,性能优化,多线程并行
MiniCPM-V 4.6:参数砍到1.3B,多模态小钢炮拿下同级第一
编程
MiniCPM-V 4.6:参数砍到1.3B,多模态小钢炮拿下同级第一
2026-05-13 17:38:45 +0800 CST
view 804
面壁智能发布MiniCPM-V 4.6,参数量仅1.3B,1B级多模态评测第一。仅用Qwen3.5-0.8B的2.5%token量即超越对方。LLaVA-UHD v4架构创新,视觉编码运算量降低55.8%,手机断网秒级响应。
MiniCPM-V
面壁智能
多模态
端侧AI
密度定律
Intel OpenVINO 2026.3 深度拆解:让 300 亿参数 MoE 模型跑进 16GB 内存的工程实践
编程
Intel OpenVINO 2026.3 深度拆解:让 300 亿参数 MoE 模型跑进 16GB 内存的工程实践
2026-08-09 03:16:31 +0800 CST
view 137
深度拆解 Intel OpenVINO 2026.3:MoE 模型磁盘卸载(16GB 运行 30B MoE)、FP8 量化、NNCF、持续批处理、至强 6+ AMX 加速、Omni 多模态流水线等核心新特性,含可运行代码与十大生产踩坑清单。
OpenVINO
Intel
AI推理
模型部署
LLM
MoE
FP8量化
持续批处理
异构计算
NPU
CPU优化
MiniCPM-V 4.6 手机实测:1.3B参数跑满端侧推理,输入框还没缩回结果就出来了
编程
MiniCPM-V 4.6 手机实测:1.3B参数跑满端侧推理,输入框还没缩回结果就出来了
2026-05-13 17:56:16 +0800 CST
view 713
MiniCPM-V 4.6手机实测体验:输入框还没缩回结果就出来了。1.3B参数推理版token消耗仅为Qwen3.5-0.8B的1/43,TTFT高清大图75.7ms快2.2倍,LLaVA-UHD v4架构视觉编码运算量降低55.8%。
MiniCPM-V
面壁智能
端侧AI
手机AI
多模态
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
84
85
86
87
88
...
95
下一页