程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
VibeVoice 深度解析:微软开源语音AI全家桶——从7.5Hz超低帧率到Next-Token Diffusion的技术革命
编程
VibeVoice 深度解析:微软开源语音AI全家桶——从7.5Hz超低帧率到Next-Token Diffusion的技术革命
2026-05-17 18:16:11 +0800 CST
view 467
微软开源的VibeVoice通过7.5Hz超低帧率连续语音分词器和Next-Token Diffusion框架,实现了60分钟长音频识别、90分钟多角色语音合成、300ms实时流式TTS三大突破,被ICLR 2026接收为Oral论文。
AI语音
语音识别
语音合成
开源项目
微软
如何使用PHP操作摄像头进行情感识别,通过表情解析分析人的情绪
编程
如何使用PHP操作摄像头进行情感识别,通过表情解析分析人的情绪
2024-11-18 11:32:03 +0800 CST
view 1740
本文介绍了如何使用PHP操作摄像头进行情感识别,通过表情解析分析人的情绪。包括准备工作、获取摄像头视频流的代码示例,以及如何使用开源的情感识别库Fer2013进行情绪推断。提供了完整的PHP代码示例,展示了实时视频流的获取和情感识别的实现,旨在帮助开发者在项目中应用摄像头情感识别技术。
编程
人工智能
情感识别
图像处理
PHP
Vue 如何识别图片中的文字,并把这些文字转化成文本
编程
Vue 如何识别图片中的文字,并把这些文字转化成文本
2024-11-19 10:07:00 +0800 CST
view 1829
本文介绍了如何在Vue.js中实现图像文字识别(OCR),主要通过集成Tesseract.js和GoogleCloudVisionAPI两种方法。Tesseract.js是一个前端JavaScript库,允许在浏览器中直接处理OCR,而GoogleCloudVisionAPI是一个强大的云端服务,提供更高的识别准确性。根据项目需求选择合适的方案,可以高效处理图像文字识别任务。
前端开发
图像处理
文字识别
JavaScript
API集成
百度 Unlimited OCR 深度解读:R-SWA 如何将 KV Cache 压成常数,5天 GitHub Star 破万的端到端 OCR 新范式
编程
百度 Unlimited OCR 深度解读:R-SWA 如何将 KV Cache 压成常数,5天 GitHub Star 破万的端到端 OCR 新范式
2026-06-27 09:15:20 +0800 CST
view 170
百度开源 Unlimited OCR,5天 GitHub Star 破万。本文深度解析其核心创新 R-SWA(Reference Sliding Window Attention),如何将解码器 KV Cache 从线性增长压成常数,OmniDocBench v1.6 刷榜 SOTA(93.92%),30B 总参/5B 激活,32K 超长上下文,一次前向全稿转录,附完整代码实战。
Unlimited OCR
R-SWA
KV Cache
MoE
端到端 OCR
百度
深度学习
Transformer
文档识别
OCR
腾讯混元开源 HyOCR-1.5 深度解读:端到端 OCR 的工程哲学与 DFlash 投机解码完全指南
编程
腾讯混元开源 HyOCR-1.5 深度解读:端到端 OCR 的工程哲学与 DFlash 投机解码完全指南
2026-07-21 12:46:56 +0800 CST
view 84
2026年7月腾讯混元开源HyOCR-1.5端到端OCR大模型,1B参数OmniDocBench 94.74分霸榜。深度拆解DFlash投机解码6.37倍加速、Agentic Data Flow自动化数据闭环、三阶段训练配方,以及vLLM/llama.cpp全场景部署实战。
HyOCR
HunyuanOCR
腾讯混元
端到端OCR
DFlash
投机解码
多模态模型
文档解析
文字识别
视觉语言模型
OmniDocBench
vLLM
llama.cpp
深度学习
Vosk-API 是一款开源的离线语音识别工具包
综合
Vosk-API 是一款开源的离线语音识别工具包
2024-11-19 07:51:49 +0800 CST
view 3916
Vosk-API是一款开源的离线语音识别工具包,支持多种编程语言和超过20种语言,提供准确可靠的语音识别服务。其特点包括轻量级模型、零延迟响应和可重构词汇量,适用于聊天机器人、智能家居设备等多种场景。Vosk-API适合在各种设备上使用,从小型设备到大型集群均可扩展。
语音识别
开源工具
技术支持
Vosk-API
零成本在本地跑 Whisper:从视频自动生成双语字幕
编程
零成本在本地跑 Whisper:从视频自动生成双语字幕
2026-06-08 15:48:58 +0800 CST
view 534
详解 whisper_v3 项目核心代码:用 Faster-Whisper 从视频自动生成带时间戳的 SRT 字幕,配合 DeepSeek API 翻译,全程跑在本地 RTX 5060 Ti 上,零成本隐私友好。
Whisper
语音识别
Faster-Whisper
Python
SRT字幕
综合
34.4K Star 最牛 OCR !!! 不要服务器, 浏览器识别 100+ 语言文本
2024-11-19 07:16:38 +0800 CST
view 2345
Tesseract.js是一款纯JavaScript的OCR库,支持超过100种语言的文本识别,能够在浏览器中独立运行,无需服务器支持。它提供自动文本检测和用户友好的API,适用于多种应用场景,如图像文本提取和文档分析。无论是初学者还是开发者,都能轻松上手,确保数据安全且响应迅速。
光学字符识别
JavaScript库
前端开发
Pynini是一个开源的Python库,专注于构建语言模型和处理字符串
编程
Pynini是一个开源的Python库,专注于构建语言模型和处理字符串
2024-11-19 04:26:54 +0800 CST
view 3704
Pynini是一个开源的Python库,专注于构建语言模型和处理字符串,利用有限状态转换器(FST)实现高效的字符串匹配和转换。它提供丰富的操作符和函数,易于与其他NLP工具集成。Pynini可用于语音识别、拼写检查和词性标注等多个领域,适合处理复杂的语言结构。
编程
自然语言处理
开源工具
机器学习
语音识别
百度 Unlimited OCR 深度解析:端到端长文档 OCR 的新范式——从 R-SWA 机制到 3B 参数模型、从 KV Cache 压缩到生产级部署的完整技术指南(2026)
编程
百度 Unlimited OCR 深度解析:端到端长文档 OCR 的新范式——从 R-SWA 机制到 3B 参数模型、从 KV Cache 压缩到生产级部署的完整技术指南(2026)
2026-07-04 03:13:57 +0800 CST
view 267
2026年6月百度开源Unlimited OCR,5天GitHub Star破1万。深度解析R-SWA机制、3B参数模型架构、KV Cache压缩原理,含完整部署代码与生产级应用案例。
百度
Unlimited OCR
OCR
R-SWA
KV Cache
长文档识别
端到端OCR
多模态模型
百度 Unlimited OCR 深度解析:R-SWA 如何让长文档 OCR 从"逐页煎熬"走向"一次搞定"
编程
百度 Unlimited OCR 深度解析:R-SWA 如何让长文档 OCR 从"逐页煎熬"走向"一次搞定"
2026-06-28 14:13:06 +0800 CST
view 385
深度解析百度 Unlimited OCR 的 R-SWA 参考滑动窗口注意力机制,如何将 KV Cache 从线性增长压到常数,使长文档 OCR 性能恒定不衰减。含完整架构分析、训练配方、性能基准和实战代码。
Unlimited OCR
R-SWA
OCR
端到端
百度
文档识别
KV Cache
MoE
DeepEncoder
长文档处理
本地优先的 AI 会议助手工程实战:从实时流式 ASR 到零云端 LLM 摘要全链路拆解
编程
本地优先的 AI 会议助手工程实战:从实时流式 ASR 到零云端 LLM 摘要全链路拆解
2026-07-10 04:42:09 +0800 CST
view 127
以 GitHub Trending 榜首 Meetily 为引,从零手搓本地优先的 AI 会议助手:麦克风采集、Silero VAD 切句、faster-whisper 流式转写、pyannote 说话人分离、Ollama 本地 LLM 摘要,含可运行代码与量化/延迟/内存优化。
本地AI
会议助手
语音识别
Whisper
Ollama
隐私计算
实时转录
RuView 深度实战:当 WiFi 信号变成「透视眼」——从 CSI 信道状态信息、穿墙感知到 ESP32 边缘 AI 的完整工程指南(2026)
编程
RuView 深度实战:当 WiFi 信号变成「透视眼」——从 CSI 信道状态信息、穿墙感知到 ESP32 边缘 AI 的完整工程指南(2026)
2026-07-21 07:15:35 +0800 CST
view 105
2026年RuView深度实战:WiFi CSI信道状态信息、穿墙感知、ESP32边缘AI、Rust高性能内核,从原理到部署的完整工程指南
RuView
WiFi
CSI
ESP32
Rust
边缘AI
智能家居
姿态估计
生命体征监测
穿墙感知
RuView 深度实战:当 WiFi 信号学会「穿墙看人」——从 CSI 信道状态信息到生产级无接触感知系统的完全指南(2026)
编程
RuView 深度实战:当 WiFi 信号学会「穿墙看人」——从 CSI 信道状态信息到生产级无接触感知系统的完全指南(2026)
2026-06-14 07:18:57 +0800 CST
view 717
深入解析 RuView 开源项目:用 9 美元 ESP32 实现 WiFi 穿墙人体感知、呼吸心率监测、跌倒检测。从 CSI 信道状态信息原理到模态转换网络架构,从 ESP32 固件烧录到 Home Assistant 集成,完整的工程实战指南。
WiFi
IoT
ESP32
智能家居
边缘AI
CSI
姿态估计
RuView 深度实战:44K Star 的 WiFi 感知革命——用无线电波"看透"世界,无需一颗摄像头
编程
RuView 深度实战:44K Star 的 WiFi 感知革命——用无线电波"看透"世界,无需一颗摄像头
2026-05-06 17:06:34 +0800 CST
view 1191
RuView 深度解析:44K Star 的 WiFi 感知项目,用无线电波实现穿墙人体姿态估计、呼吸心率监测,无需摄像头。从 CSI 原理、WiFlow 架构到部署实践,全面解析边缘 AI 感知技术。
WiFi
CSI
ESP32
Rust
边缘计算
物联网
智能家居
姿态估计
穿墙感知时代来临:深度拆解 RuView 如何用 WiFi 信号实现人体姿态估计
编程
穿墙感知时代来临:深度拆解 RuView 如何用 WiFi 信号实现人体姿态估计
2026-07-21 11:14:07 +0800 CST
view 133
2026年现象级开源项目RuView深度拆解:如何用WiFi CSI信号实现无摄像头人体姿态估计、穿墙检测与生命体征监测,附Rust实现与ESP32部署指南。
Rust
WiFi CSI
姿态估计
边缘计算
ESP32
信号处理
SNN
机器学习
「WiFi就是传感器:开源项目RuView如何用普通路由器实现无摄像头人体感知」
编程
「WiFi就是传感器:开源项目RuView如何用普通路由器实现无摄像头人体感知」
2026-07-09 06:17:11 +0800 CST
view 190
深入解析开源项目RuView如何利用普通WiFi信号实现无摄像头的人体姿态追踪与生命体征监测,包含技术架构、代码实现与性能对比。
wifi
感知
物联网
RuView
ESP32
姿态估计
隐私
RuView 深度实战:45K+ Star 的 WiFi 信号人体感知系统——从 CSI 原理到边缘 AI 部署的全链路架构解析
编程
RuView 深度实战:45K+ Star 的 WiFi 信号人体感知系统——从 CSI 原理到边缘 AI 部署的全链路架构解析
2026-05-07 19:37:51 +0800 CST
view 717
深度解析 45K+ Star 的 RuView 项目——基于 WiFi CSI 的边缘 AI 感知系统,实现无摄像头人体姿态估计、生命体征监测和穿墙检测。从技术原理、硬件方案到代码实战的完整指南。
WiFi感知
CSI
ESP32
Rust
边缘AI
姿态估计
物联网
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
2
下一页