程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
端侧推理 相关技术文章
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
星火 X2.5 端侧模型发布:4B/1.7B 参数、百万上下文与 MOPD 蒸馏怎么看
资讯
星火 X2.5 端侧模型发布:4B/1.7B 参数、百万上下文与 MOPD 蒸馏怎么看
2026-09-02 20:37:02
梳理词元星火 9 月发布的端侧开源模型 Spark X2.5(4B/1.7B):评测数据、百万 token 混合注意力、MOPD 在线蒸馏、BF16 体积与部署栈兼容性,并对营销宣称做了标注。
AI模型
端侧推理
大模型
开源权重
工具调用
编程
microduck:会打滚、会自己爬起来的开源双足机器人
2026-08-30 19:17:50
解析开源双足机器人 microduck:RK3566 主控 + 15 舵机,强化学习在仿真训练后导出 ONNX 端侧推理。讲清技术选型、控制频率、开源范围与适用边界,适合想复现或研究端侧 RL 的人参考。
microduck
双足机器人
强化学习
ONNX
端侧推理
RK3566
开源硬件
llama.cpp 深度拆解:一个纯 C++ 引擎如何让 180K Star 成为端侧 LLM 的事实标准——从 GGUF 格式到多后端架构的全栈解析
编程
llama.cpp 深度拆解:一个纯 C++ 引擎如何让 180K Star 成为端侧 LLM 的事实标准——从 GGUF 格式到多后端架构的全栈解析
2026-08-03 10:45:17
深度拆解llama.cpp四大核心架构:GGUF模型格式设计、GGML计算引擎、8种多后端抽象层、K-Quant/I-Quant量化技术体系,附完整代码示例与性能基准测试
llama.cpp
GGUF
GGML
量化
端侧推理
LLM
C++
推理引擎
多后端
K-Quant
1.58-bit 大模型极限量化实战:从 BitNet 三值权重到单颗 CPU 跑起 100B 模型
编程
1.58-bit 大模型极限量化实战:从 BitNet 三值权重到单颗 CPU 跑起 100B 模型
2026-07-21 16:20:29
2026极限量化实战:BitNet三值权重、absmean/absmax量化、BitLinear实现、带宽数学与bitnet.cpp内核优化,单CPU跑100B模型。
BitNet
1.58-bit
大模型量化
LLM
端侧推理
bitnet.cpp
当 WASM 遇上 WebGPU:浏览器端 AI 推理的第三次革命——用 Web 技术重写本地智能的心智模型
编程
当 WASM 遇上 WebGPU:浏览器端 AI 推理的第三次革命——用 Web 技术重写本地智能的心智模型
2026-07-15 14:17:19
深度拆解 2026 年 WebGPU、WASM 与 WebNN 融合技术:三层计算模型、WGSL 编写、GEMM 量化推理、KV Cache、算子融合,配完整代码与性能基准。
WebGPU
WASM
WebNN
浏览器AI
WGSL
端侧推理
WebLLM
前端工程化
WebNN + WebGPU + WASM 三端融合:2026年浏览器端AI推理的终极架构——从零构建生产级推理引擎
编程
WebNN + WebGPU + WASM 三端融合:2026年浏览器端AI推理的终极架构——从零构建生产级推理引擎
2026-06-27 07:12:19
2026年WebNN、WebGPU、WASM三端融合的浏览器端AI推理架构深度实战。从环境探测、模型加载、推理执行到性能优化,完整代码实现生产级推理引擎。
WebNN
WebGPU
WASM
浏览器AI推理
ONNX Runtime
NPU加速
端侧推理
llama.cpp 深度实战:当 C/C++ 重写遇见端侧 LLM 推理——从 GGUF 量化到 Apple Silicon 38 tokens/s 的生产级完全指南(2026)
编程
llama.cpp 深度实战:当 C/C++ 重写遇见端侧 LLM 推理——从 GGUF 量化到 Apple Silicon 38 tokens/s 的生产级完全指南(2026)
2026-06-16 01:17:28
llama.cpp 是端侧 LLM 推理的事实标准(180K+ Stars)。本文从源码架构、GGUF 格式、量化方法、跨平台后端、生产部署、性能优化到 DeepSeek V4 Flash 实战,全方位讲解本地 AI 推理。
llama.cpp
GGUF
量化
端侧推理
本地AI
C/C++
Apple Silicon
llama.cpp 深度实战:当端侧 LLM 成为生产级事实标准——从 GGUF 量化到跨平台部署的完全指南(2026)
编程
llama.cpp 深度实战:当端侧 LLM 成为生产级事实标准——从 GGUF 量化到跨平台部署的完全指南(2026)
2026-06-11 00:19:05
全面解析 llama.cpp 推理引擎,从 GGUF 格式、量化原理、架构设计到跨平台部署,提供生产级代码实战和性能优化指南。
llama.cpp
GGUF
量化
端侧推理
大语言模型
Google AI Edge Gallery 深度实战:让 Mac/Android 离线运行 Gemma 3——从原理到生产级本地 AI 部署完全指南(2026)
编程
Google AI Edge Gallery 深度实战:让 Mac/Android 离线运行 Gemma 3——从原理到生产级本地 AI 部署完全指南(2026)
2026-06-04 21:14:37
深入剖析 Google AI Edge Gallery 的技术架构、Gemma 模型家族、端侧部署全流程,并通过完整代码示例,带你从零构建一个生产级本地 AI 应用。
Google AI Edge Gallery
本地AI
Gemma模型
端侧推理
Mac AI
Android AI
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
python
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调