程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
KTransformers 深度拆解:一块 RTX 5090 跑 100B+ 大模型,CPU/GPU 异构推理凭什么改写 LLM 本地部署规则
编程
KTransformers 深度拆解:一块 RTX 5090 跑 100B+ 大模型,CPU/GPU 异构推理凭什么改写 LLM 本地部署规则
2026-07-24 07:44:31 +0800 CST
view 221
KTransformers 通过 CPU/GPU 异构计算,让一块 RTX 5090(32GB 显存)能跑起 100B+ MoE 大模型,且无需量化压缩,保持原精度 FP16。实测比 llama.cpp Q8_0 快 4.5 倍。本文深度拆解其专家细粒度卸载、异步预取、DMA 优化等核心技术,以及实战部署指南。
KTransformers
LLM推理
MoE
异构计算
DeepSeek
SGLang
CPU Offload
本地部署
GPU优化
PostgreSQL 18 深度拆解:从 AIO 底层革命到查询优化器重塑——工程全貌与生产级实践(2026)
编程
PostgreSQL 18 深度拆解:从 AIO 底层革命到查询优化器重塑——工程全貌与生产级实践(2026)
2026-07-18 15:14:24 +0800 CST
view 230
深度拆解 PostgreSQL 18:AIO 子系统带来 3 倍 I/O 性能提升、查询优化器全面增强、B-tree Skip Scan 解放多列索引、虚拟生成列零存储成本、uuidv7 时间有序 ID、OAuth 原生认证支持,含完整代码实战与生产升级指南
PostgreSQL
数据库
AIO
SkipScan
uuidv7
OAuth
1.6万亿参数,1M上下文,仅需27%算力:DeepSeek-V4-Pro 如何重新定义长文本推理
编程
1.6万亿参数,1M上下文,仅需27%算力:DeepSeek-V4-Pro 如何重新定义长文本推理
2026-05-11 10:53:54 +0800 CST
view 720
DeepSeek-V4-Pro 以 1.6T 总参数、49B 激活参数的 MoE 架构,原生支持 100 万 token 上下文,同时将推理算力降至 V3.2 的 27%、KV Cache 降至 10%。本文深度解析 CSA/HCA 混合注意力机制、mHC 流形约束超连接、KV Cache 极致优化、Muon 优化器等核心技术创新,以及如何在 Ollama、vLLM、官方 API 三种方式下部署运行。
DeepSeek-V4,MoE架构,CSA注意力,HCA注意力,KV Cache,1M上下文,长文本推理,开源大模型
DSpark深度解析:DeepSeek联合北大开源的推测解码框架——半自回归生成+置信度调度如何让大模型推理速度飙升85%
编程
DSpark深度解析:DeepSeek联合北大开源的推测解码框架——半自回归生成+置信度调度如何让大模型推理速度飙升85%
2026-07-06 07:43:51 +0800 CST
view 500
深度解析DeepSeek联合北京大学开源的DSpark推测解码推理加速框架:半自回归生成架构解决后缀衰减、置信度调度验证机制避免算力浪费、单用户生成速度提升60%-85%、吞吐量最高暴涨661%。含完整代码实战与性能基准测试。
DSpark
DeepSeek
推测解码
Speculative Decoding
推理加速
半自回归
置信度调度
大模型推理
DeepSeek-TUI 深度解析:Rust 打造的终端 AI 编程 Agent——从 1M 上下文到 RLM 多智能体并发的完整技术架构
编程
DeepSeek-TUI 深度解析:Rust 打造的终端 AI 编程 Agent——从 1M 上下文到 RLM 多智能体并发的完整技术架构
2026-05-17 07:14:51 +0800 CST
view 763
深度拆解 DeepSeek-TUI:99.3% Rust 编写的终端 AI 编程 Agent,1M 上下文、RLM 多智能体并发、前缀缓存优化、OS 级沙箱的完整技术架构与实战指南
DeepSeek
AI编程
Rust
终端Agent
开源项目
Strix 深度解析:34K+ Stars 的 AI 渗透测试黑客——多智能体协作、Docker 沙箱与 PoC 自动验证如何将安全测试从「可能有」推向「确实有」
编程
Strix 深度解析:34K+ Stars 的 AI 渗透测试黑客——多智能体协作、Docker 沙箱与 PoC 自动验证如何将安全测试从「可能有」推向「确实有」
2026-07-06 08:43:57 +0800 CST
view 477
深度解析Strix开源AI渗透测试工具:34K+ Stars,多智能体协作架构(侦察/漏洞利用/权限提升三大AI代理)、14种漏洞类型PromptModule专家系统、Docker沙箱隔离执行、Caido+Playwright+Nuclei工具链集成、LiteLLM多模型策略、三层验证机制、CI/CD集成实战。OWASP Top 10全覆盖+业务逻辑漏洞检测,从「可能有漏洞」到「确实有漏洞」的质变。
Strix
AI渗透测试
安全测试
多智能体
OWASP
Docker
PoC
DevSecOps
Warp 开源深度解析:从 Rust 终端重写到 Agentic 开发环境——57K Star 背后的架构设计与 Agent 编排实战
编程
Warp 开源深度解析:从 Rust 终端重写到 Agentic 开发环境——57K Star 背后的架构设计与 Agent 编排实战
2026-05-17 08:16:30 +0800 CST
view 772
Warp终端开源深度解析:从Rust高性能渲染、Block架构、AI Agent编排到Oz云端平台的完整技术架构拆解
Warp
Rust
终端
AI Agent
Oz
开源
Agentic
DevOps
DwarfStar 4 深度拆解:当 Redis 之父决定「给 284B 大模型造一个专属引擎」——从 Metal GPU 到磁盘 KV 缓存,一个 10K Star 的极简推理栈如何用 One Model One Engine 哲学重新定义本地 AI 推理的终极形态
编程
DwarfStar 4 深度拆解:当 Redis 之父决定「给 284B 大模型造一个专属引擎」——从 Metal GPU 到磁盘 KV 缓存,一个 10K Star 的极简推理栈如何用 One Model One Engine 哲学重新定义本地 AI 推理的终极形态
2026-08-05 12:17:17 +0800 CST
view 130
深度拆解Redis创始人antirez打造的DeepSeek V4 Flash专用本地推理引擎DwarfStar 4:One Model One Engine哲学、非对称量化策略、磁盘KV缓存、双协议兼容层,附完整架构分析与性能基准
DwarfStar
DeepSeek
本地推理
MoE
Metal
Apple Silicon
antirez
Redis
AI推理
开源
潜伏9年、一键提权:Linux 内核 CVE-2026-31431 "Copy Fail" 漏洞深度剖析与攻防实战
编程
潜伏9年、一键提权:Linux 内核 CVE-2026-31431 "Copy Fail" 漏洞深度剖析与攻防实战
2026-07-12 11:44:44 +0800 CST
view 1203
深度剖析 CVE-2026-31431:Linux 内核 9 年潜伏的高危本地提权漏洞。从 AF_ALG 加密子系统与 splice() 零拷贝的致命组合,到 732 字节 PoC 完整攻击链,配容器逃逸场景分析与全发行版修复方案。
Linux内核
CVE
漏洞
安全
提权
容器
DevOps
AF_ALG
WSL Containers深度解析:微软如何用原生能力颠覆Windows容器生态
编程
WSL Containers深度解析:微软如何用原生能力颠覆Windows容器生态
2026-06-30 17:44:36 +0800 CST
view 347
2026年6月微软Build大会发布的WSL Containers,允许Windows开发者无需Docker Desktop即可运行Linux容器。万字深度解析其技术架构、GPU直通、企业管理和与Docker Desktop的完整对比。
WSL
WSL Containers
Windows 11
Docker Desktop
容器化
Linux
Kubernetes
GPU直通
Coreutils
微软
DevOps
DeepGEMM 深度解析:DeepSeek 开源的 FP8 GEMM 内核如何重塑 AI 推理性能边界
编程
DeepGEMM 深度解析:DeepSeek 开源的 FP8 GEMM 内核如何重塑 AI 推理性能边界
2026-04-21 05:16:09 +0800 CST
view 1076
深入剖析 DeepSeek 开源的 DeepGEMM 库:从 FP8 精度革命到 1550 TFLOPS 性能突破,揭秘现代 AI 推理基础设施的底层优化技术
DeepGEMM
FP8
DeepSeek
CUDA
AI推理
GPU优化
GEMM
TensorCore
ds4 深度解析:当 Redis 之父用 C 语言手写 AI 推理引擎——从「窄而深」哲学到把 284B 模型塞进一台 MacBook 的技术全拆解
编程
ds4 深度解析:当 Redis 之父用 C 语言手写 AI 推理引擎——从「窄而深」哲学到把 284B 模型塞进一台 MacBook 的技术全拆解
2026-06-12 18:19:08 +0800 CST
view 747
深度解析 Redis 之父 antirez 最新开源项目 ds4(DwarfStar):一个纯 C 语言手写的 DeepSeek V4 Flash 本地推理引擎。从「窄而深」的工程哲学、非对称 2-bit 量化、磁盘 KV 缓存、Metal/CUDA 内核优化到实际部署,完整拆解这个 13K+ Star 项目的技术内幕。
AI推理引擎
DeepSeek
本地推理
系统编程
开源项目
C语言
2026大模型推理框架终极对决:vLLM 0.5 vs TGI 2.0 vs TensorRT-LLM 1.8 vs DeepSpeed-MII 0.9——谁才是生产级部署的真正王者?
编程
2026大模型推理框架终极对决:vLLM 0.5 vs TGI 2.0 vs TensorRT-LLM 1.8 vs DeepSpeed-MII 0.9——谁才是生产级部署的真正王者?
2026-06-23 08:22:26 +0800 CST
view 581
深度对比2026年四大主流大模型推理框架:vLLM 0.5、TGI 2.0、TensorRT-LLM 1.8、DeepSpeed-MII 0.9,从核心架构、性能压测、成本分析到代码实战的完全指南。
vLLM
TensorRT-LLM
大模型推理
性能优化
DeepSpeed
TGI
架构即代码不是画图:LikeC4 深度解剖——从 DSL 内核到多视图布局引擎的工程真相
编程
架构即代码不是画图:LikeC4 深度解剖——从 DSL 内核到多视图布局引擎的工程真相
2026-07-25 02:43:56 +0800 CST
view 324
从第一性原理深度拆解 LikeC4:DSL 三段式设计、Langium 语言内核、computed model、谓词驱动多视图、自动布局引擎、MCP AI 集成,以及接入 CI 让架构漂移变成红色构建的落地实战。
LikeC4
架构即代码
C4模型
DSL
Structurizr
可视化
Langium
DevOps
综合
Mayfly-Go:轻量级分布式任务调度与管理平台
2024-11-18 02:19:47 +0800 CST
view 1677
Mayfly-Go是一个基于Go语言开发的轻量级分布式任务调度与管理平台,适用于前后端开发者。它具备开源社区支持、模块化设计、高性能与可扩展性,以及前后端分离架构,能够有效管理和监控系统任务,特别适合小型到中型企业和开发者个人项目。该平台简洁高效,易于上手,推荐大家试用。
项目管理
开发工具
开源软件
DevOps
任务调度
英伟达免费开放H100算力:DeepSeek、Kimi、GLM等主流大模型API免费用
编程
英伟达免费开放H100算力:DeepSeek、Kimi、GLM等主流大模型API免费用
2026-04-21 13:09:34 +0800 CST
view 2217
英伟达Build平台免费开放H100算力和主流大模型API,支持DeepSeek、Kimi、GLM等,3步拿到Key,代码对接OpenAI格式即可使用。
NVIDIA
大模型
免费API
DeepSeek
Kimi
wrkflw 深度解析:告别「fix ci」无限循环——本地运行 GitHub Actions 的完整技术内幕
编程
wrkflw 深度解析:告别「fix ci」无限循环——本地运行 GitHub Actions 的完整技术内幕
2026-05-17 23:47:51 +0800 CST
view 578
wrkflw深度解析:如何用Rust打造的CLI工具在本地运行GitHub Actions,告别fix ci无限循环
GitHub Actions
CI/CD
Rust
DevOps
wrkflw
Kubernetes 生产调试安全实战:从「权限裸奔」到「零信任访问」的架构演进(2026)
编程
Kubernetes 生产调试安全实战:从「权限裸奔」到「零信任访问」的架构演进(2026)
2026-06-04 10:50:22 +0800 CST
view 516
凌晨三点,支付系统报警。你SSH到跳板机,用 `kubectl exec` 进 Pod,敲下 `curl localhost:8080/debug/pprof`。问题定位了,故障修复了,但你有没有想过:
Kubernetes
安全
DevOps
RBAC
零信任
生产调试
2026 LLM 推理框架深度拆解:当 vLLM 0.5 决定「让 PagedAttention 吞掉最后一块显存碎片」——从 PagedAttention 到 FlashAttention 3.0,四大推理框架如何用「算子融合 + 量化混合 + 动态批处理」重新定义大模型推理的终极形态
编程
2026 LLM 推理框架深度拆解:当 vLLM 0.5 决定「让 PagedAttention 吞掉最后一块显存碎片」——从 PagedAttention 到 FlashAttention 3.0,四大推理框架如何用「算子融合 + 量化混合 + 动态批处理」重新定义大模型推理的终极形态
2026-08-06 06:16:32 +0800 CST
view 100
深度拆解2026年四大主流LLM推理框架:vLLM 0.5 PagedAttention进化、TGI 2.0流式输出优化、TensorRT-LLM 1.8算子融合、DeepSpeed-MII 0.9自动优化,含完整架构分析、代码实战、性能基准测试与成本计算
LLM
vLLM
TensorRT-LLM
推理框架
PagedAttention
量化
GPU
H100
大模型
DeepSpeed
TGI
DeepSeek V4 Flash 深度拆解:第一个为智能体而生的开源 MoE——从 2840 亿参数稀疏架构、百万上下文到 Agentic 工作流实战(2026)
编程
DeepSeek V4 Flash 深度拆解:第一个为智能体而生的开源 MoE——从 2840 亿参数稀疏架构、百万上下文到 Agentic 工作流实战(2026)
2026-07-20 01:43:13 +0800 CST
view 240
2026年OpenRouter开源F4之首DeepSeek V4 Flash深度拆解:MoE稀疏架构、百万上下文、FP8单卡部署与Agentic工具调用实战
DeepSeek
V4
MoE
开源大模型
AI智能体
vLLM
推理部署
里程碑!AI Agent 现在可以自己注册账号、购买域名、部署上线了
案例
里程碑!AI Agent 现在可以自己注册账号、购买域名、部署上线了
2026-05-04 07:37:15 +0800 CST
view 643
Cloudflare与Stripe合作推出Stripe Projects,让AI Agent可以自动完成账号创建、域名购买和应用部署,无需人工介入,标志着Agent能力边界的重要突破
Cloudflare
Stripe
AI Agent
自动化部署
无服务器
DevOps
Kubernetes Agent Sandbox 深度拆解:当 K8s 决定「给 AI Agent 造一个正经的家」——从 Sandbox CRD 到 WarmPool 预热池,一个 SIG 级开源项目如何用「声明式隔离 + 单容器 VM 体验」重新定义云原生 AI Agent 运行时的终极形态
编程
Kubernetes Agent Sandbox 深度拆解:当 K8s 决定「给 AI Agent 造一个正经的家」——从 Sandbox CRD 到 WarmPool 预热池,一个 SIG 级开源项目如何用「声明式隔离 + 单容器 VM 体验」重新定义云原生 AI Agent 运行时的终极形态
2026-08-06 08:15:49 +0800 CST
view 301
深度拆解Kubernetes SIG Apps开源项目Agent Sandbox:Sandbox CRD声明式API、SandboxTemplate标准化模板、SandboxClaim消费者接口、SandboxWarmPool预热池200ms分配延迟、gVisor/Kata安全隔离、与AI Gateway协同、Google GKE Agent Substrate、生产环境部署指南、与AWS Bedrock AgentCore对比
Kubernetes
Agent Sandbox
AI Agent
gVisor
Kata Containers
Cloud Native
容器隔离
SIG Apps
GKE
预热池
Kubewarden 深度解析:WebAssembly 驱动的 Kubernetes 策略引擎,让安全策略编写不再受限
编程
Kubewarden 深度解析:WebAssembly 驱动的 Kubernetes 策略引擎,让安全策略编写不再受限
2026-04-22 05:20:13 +0800 CST
view 758
Kubewarden 是一个基于 WebAssembly 的 Kubernetes 策略引擎,支持用任意编程语言编写策略。本文深度解析其架构设计、实战部署、策略开发和性能优化,帮助你掌握这一云原生安全利器。
Kubernetes
Kubewarden
WebAssembly
云原生
安全策略
容器编排
CNCF
DevOps
大模型部署太慢?这个超级引擎帮你搞定!SGLang速通指南
编程
大模型部署太慢?这个超级引擎帮你搞定!SGLang速通指南
2026-04-22 09:27:57 +0800 CST
view 838
DeepSeek官方推荐!SGLang高性能大模型推理框架速通指南,RadixAttention前缀缓存、零开销调度、OpenAI API兼容,性能碾压vLLM。
SGLang
大模型推理
DeepSeek
开源
vLLM
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
14
15
16
17
18
...
81
下一页