程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
Flipbook:无限视觉浏览器,UI的终极形态来了?
编程
Flipbook:无限视觉浏览器,UI的终极形态来了?
2026-04-27 06:11:36 +0800 CST
view 1399
前OpenAI研究员Zain Shah团队发布Flipbook,用AI像素流彻底替代HTML/CSS,成为可以实时生成百科全书式动态插画的无限视觉浏览器。本文深度解析其原理、特性、局限与未来影响。
AI
Flipbook
UI设计
未来技术
视觉交互
Dexora 深度实战:首个 36 自由度双臂灵巧操作 VLA 模型完全指南——从 ICRA 2026 开源突破到生产级机器人部署(2026)
编程
Dexora 深度实战:首个 36 自由度双臂灵巧操作 VLA 模型完全指南——从 ICRA 2026 开源突破到生产级机器人部署(2026)
2026-06-02 13:53:45 +0800 CST
view 1084
Dexora 作为首个原生支持 36 自由度双臂灵巧操作的开放 VLA 模型在 ICRA 2026 正式开源,本文深度拆解其四层技术架构、训练数据、代码实战与生产级部署方案。
VLA模型
Dexora
机器人
ICRA 2026
具身智能
双臂协同
视觉语言动作模型
在 Rust 中使用 OpenCV 进行绘图
编程
在 Rust 中使用 OpenCV 进行绘图
2024-11-19 06:58:07 +0800 CST
view 1990
本文详细介绍了如何在Rust中使用OpenCV进行绘图,包括绘制线条、形状和文本。OpenCV提供了丰富的绘图函数和参数选项,涵盖了直线、矩形、圆形、椭圆、多边形及文本的添加,配有示例代码,帮助读者理解和应用这些功能。
编程
计算机视觉
图像处理
Rust
OpenCV
当 Apple Silicon 遇上视觉大模型:MLX-VLM 如何把「本地多模态推理」变成现实
编程
当 Apple Silicon 遇上视觉大模型:MLX-VLM 如何把「本地多模态推理」变成现实
2026-04-11 10:24:48 +0800 CST
view 834
深度解析 Apple Silicon 上的视觉语言模型推理引擎 MLX-VLM,涵盖架构设计、模型支持、性能优化与实战部署。
Apple Silicon
MLX
视觉语言模型
VLM
Mac本地AI
多模态推理
视觉即代码:GLM-5V-Turbo 如何用 94.8 分重新定义 Design2Code
编程
视觉即代码:GLM-5V-Turbo 如何用 94.8 分重新定义 Design2Code
2026-05-11 09:52:48 +0800 CST
view 658
智谱AI发布GLM-5V-Turbo多模态编程基座模型,从预训练阶段原生融合视觉与语言,在Design2Code基准测试中以94.8分超越所有竞品。本文深度解析CogViT视觉编码器、MMTP多模态多Token预测、多任务RL优化等技术细节,以及如何用API接入实现从设计稿到可运行代码的完整工作流。
GLM-5V-Turbo
视觉编程
Design2Code
多模态
CogViT
MMTP
智谱AI
AI编程
Agent TARS 深度解析:字节跳动开源的「视觉-行动」双引擎 GUI Agent——从 UI-TARS 模型架构到计算机控制的完整技术内幕
编程
Agent TARS 深度解析:字节跳动开源的「视觉-行动」双引擎 GUI Agent——从 UI-TARS 模型架构到计算机控制的完整技术内幕
2026-05-17 14:14:17 +0800 CST
view 730
深入解析字节跳动开源的 Agent TARS / UI-TARS-Desktop 多模态 GUI Agent 技术栈,从底层视觉语言模型到三层感知-规划-执行 Pipeline,配详细代码示例和实战案例。
AI Agent
GUI自动化
字节跳动
多模态
UI-TARS
计算机视觉
VLM
MCP
Python
万字深度解析百度 Unlimited OCR:当 R-SWA 遇见 MoE——3B 参数如何碾压端到端 OCR 全场(2026)
编程
万字深度解析百度 Unlimited OCR:当 R-SWA 遇见 MoE——3B 参数如何碾压端到端 OCR 全场(2026)
2026-07-01 03:42:17 +0800 CST
view 265
2026年6月百度开源Unlimited OCR,5天GitHub Star破万。深度解析R-SWA注意力机制、MoE架构、16倍视觉Token压缩,以及为何能将KV Cache从线性增长压成常数。
Unlimited OCR
OCR
R-SWA
MoE
百度
深度学习
计算机视觉
文档识别
KV Cache
sagiri,一个Python中非常有用的图像处理库
综合
sagiri,一个Python中非常有用的图像处理库
2024-11-17 11:40:16 +0800 CST
view 1773
sagiri是一个功能强大的Python图像处理库,提供丰富的API,支持图像加载、显示、转换、滤波、边缘检测、轮廓检测和特征匹配等功能。本文介绍了sagiri的安装、基本用法和实际案例,展示了如何使用该库进行人脸检测等任务。sagiri适用于数据处理、科学研究和计算机视觉项目,是一个简单且强大的选择。
图像处理
Python库
计算机视觉
WiFi信号透视人体:RuView用9美元ESP32实现无摄像头姿态估计,一场颠覆计算机视觉的技术革命
编程
WiFi信号透视人体:RuView用9美元ESP32实现无摄像头姿态估计,一场颠覆计算机视觉的技术革命
2026-07-13 07:45:17 +0800 CST
view 189
RuView用9美元ESP32实现WiFi信号人体姿态估计,无需摄像头,隐私友好,穿墙透视,实时54,000fps,一场颠覆计算机视觉的技术革命。
RuView
WiFi感知
CSI
人体姿态估计
ESP32
Rust
边缘AI
隐私计算
计算机视觉
开源项目
当AI第一次"长出眼睛":o3/o4-mini视觉推理架构深度拆解,从TIR思维中间表示到Codex CLI的视觉编程革命
编程
当AI第一次"长出眼睛":o3/o4-mini视觉推理架构深度拆解,从TIR思维中间表示到Codex CLI的视觉编程革命
2026-07-13 09:15:10 +0800 CST
view 143
深度拆解o3/o4-mini视觉推理核心架构:TIR思维中间表示、空间关系图谱、符号化操作序列、双编码器-解码器架构,配Codex CLI完整实战代码与性能优化指南。
o3
o4-mini
视觉推理
TIR
Codex CLI
OpenAI
多模态
AI编程
三行CSS实现惊艳像素化效果:揭秘Element-plus官网视觉魔法
编程
三行CSS实现惊艳像素化效果:揭秘Element-plus官网视觉魔法
2025-08-19 16:30:01 +0800 CST
view 1681
本文深入剖析了Element-plus官网的像素化效果,展示了如何用三行CSS代码实现复古像素风格。通过创建半透明像素网格遮罩层,结合径向渐变和模糊滤镜,用户可以轻松复现这一视觉效果。文章还提供了代码示例、参数调优指南及技术原理解析,强调了CSS在视觉设计中的强大能力。
CSS
前端开发
视觉设计
用户体验
技术解析
流式3D重建的工程革命:lingbot-map 如何用几何上下文Transformer颠覆实时空间感知
编程
流式3D重建的工程革命:lingbot-map 如何用几何上下文Transformer颠覆实时空间感知
2026-07-25 19:44:11 +0800 CST
view 24
深度解析2026年GitHub爆火项目lingbot-map:从传统离线重建困境到前馈式流式架构,深入拆解几何上下文Transformer的极线约束、深度先验机制,附完整Python实战代码与性能调优指南。
流式3D重建
lingsbot-map
几何上下文Transformer
实时重建
计算机视觉
点云
SLAM
深度学习
前馈网络
机器人导航
HTML文档,包含用于创建星空背景的CSS样式
代码
HTML文档,包含用于创建星空背景的CSS样式
2024-11-18 11:27:40 +0800 CST
view 1657
该文本是一个HTML文档,包含用于创建星空背景的CSS样式。通过使用渐变和动画效果,页面展示了一个动态的星空效果。文档结构包括头部和主体,主体中包含多个星星的div元素,以及一个显示标题的div。整体设计旨在提供视觉上的美感和动态效果。
网页设计
前端开发
视觉效果
开源!低代码AI模型训练系统:工业级智能开发平台深度解析
案例
开源!低代码AI模型训练系统:工业级智能开发平台深度解析
2026-05-05 19:05:49 +0800 CST
view 629
开源低代码AI模型训练系统,工业级智能开发平台,图像采集、智能检测、数据标注、模型训练四大模块,单张检测<2秒,字符识别率≥99.5%
AI
深度学习
工业智能
低代码
机器视觉
模型训练
工业质检
腾讯混元开源 HyOCR-1.5 深度解读:端到端 OCR 的工程哲学与 DFlash 投机解码完全指南
编程
腾讯混元开源 HyOCR-1.5 深度解读:端到端 OCR 的工程哲学与 DFlash 投机解码完全指南
2026-07-21 12:46:56 +0800 CST
view 107
2026年7月腾讯混元开源HyOCR-1.5端到端OCR大模型,1B参数OmniDocBench 94.74分霸榜。深度拆解DFlash投机解码6.37倍加速、Agentic Data Flow自动化数据闭环、三阶段训练配方,以及vLLM/llama.cpp全场景部署实战。
HyOCR
HunyuanOCR
腾讯混元
端到端OCR
DFlash
投机解码
多模态模型
文档解析
文字识别
视觉语言模型
OmniDocBench
vLLM
llama.cpp
深度学习
编程
Poster-Design:开源海报设计工具的完全指南与核心技术解析
2025-09-01 09:49:16 +0800 CST
view 1478
Poster-Design是一个功能强大的开源海报设计工具,旨在满足日益增长的高质量视觉设计需求。它基于现代Web技术栈构建,提供从简单图片编辑到复杂排版设计的全方位能力。本文深入解析其架构设计、核心功能及快速创建专业级视觉内容的方法,适用于电商、社交媒体、企业宣传等多个场景。
设计工具
开源软件
视觉设计
技术架构
开发
Mano-P + Cider:4B模型本地操控Mac,端侧GUI Agent新时代
案例
Mano-P + Cider:4B模型本地操控Mac,端侧GUI Agent新时代
2026-05-07 13:34:32 +0800 CST
view 488
明略科技开源Mano-P(4B量化模型本地操控Mac)和Cider(MLX推理加速框架)。476 tokens/s预填充,76 tokens/s解码,峰值内存4.3GB,完全本地运行数据不出设备,离线长任务自主规划
GUI Agent
端侧AI
Apple Silicon
MLX
视觉理解
本地运行
Mano-P
Cider
编程
OpenCV 检测与跟踪移动物体
2024-11-18 15:27:01 +0800 CST
view 2324
本文介绍了如何使用OpenCV和Python检测与跟踪移动物体,重点讲解了背景减除器的工作原理及其在视频流中的应用。通过比较帧之间的差异,背景减除技术能够有效隔离前景物体。文中详细描述了KNN和MOG2两种背景减除器的实现过程,并提供了相应的代码示例,帮助读者理解如何在实际应用中进行目标检测与追踪。
计算机视觉
目标检测
视频处理
markdowns滚动事件
编程
markdowns滚动事件
2024-11-19 10:07:32 +0800 CST
view 3237
该代码片段实现了两个元素之间的同步滚动功能,确保当用户在一个元素中滚动时,另一个元素也会相应滚动。此外,当用户在内容区域输入文本时,Markdown函数会被调用,将输入的文本转换为Markdown格式并显示在另一个区域。
前端开发
JavaScript
用户交互
代码
底部导航栏
2024-11-19 01:12:32 +0800 CST
view 1703
该文本展示了一个底部导航栏的HTML和CSS实现,包含了样式设置、动画效果和JavaScript交互。导航栏使用了弹性盒布局,包含多个导航项,每个项都有不同的颜色和图标。通过JavaScript实现了点击切换选中状态的功能,增强了用户体验。整体设计注重语义化和响应式布局,适合现代网页应用。
前端开发
网页设计
用户界面
交互设计
如何实现元素的拖动功能,包括简单元素的拖动、列表项的拖动以及表格列和行的拖动
编程
如何实现元素的拖动功能,包括简单元素的拖动、列表项的拖动以及表格列和行的拖动
2024-11-18 15:30:45 +0800 CST
view 1623
本文介绍了如何实现元素的拖动功能,包括简单元素的拖动、列表项的拖动以及表格列和行的拖动。通过处理鼠标的mousedown、mousemove和mouseup事件,结合动态DOM操作,读者可以掌握拖动效果的实现技巧,提升用户体验。文中提供了详细的HTML和JavaScript代码示例,帮助读者理解拖动功能的核心逻辑和实现方法。
前端开发
用户交互
JavaScript
DOM操作
CSS
Linux 7.0 内核 AI 功能键深度解析:当操作系统第一次把「AI 交互」写进硬件协议
编程
Linux 7.0 内核 AI 功能键深度解析:当操作系统第一次把「AI 交互」写进硬件协议
2026-04-12 01:22:57 +0800 CST
view 522
深度解析 Linux 7.0 内核新增的三个 AI 功能键:Action on Selection、Contextual Insertion、Contextual Query。从 HID 协议扩展、内核实现、桌面环境适配到实战代码,全面剖析操作系统层面的 AI 交互标准如何落地。
Linux内核
Linux 7.0
HID协议
AI交互
操作系统
开源
桌面环境
AI功能键
Linux 7.0 内核 AI 功能键深度解析:当操作系统首次将 AI 交互写入硬件协议
编程
Linux 7.0 内核 AI 功能键深度解析:当操作系统首次将 AI 交互写入硬件协议
2026-04-12 01:23:42 +0800 CST
view 1284
深度解析 Linux 7.0 内核新增的三个 AI 功能键:Action on Selection、Contextual Insertion、Contextual Query,从 HID 协议扩展、内核实现、桌面环境适配到实战代码,全面剖析操作系统层面的 AI 交互标准如何落地。
Linux内核
Linux 7.0
HID协议
AI交互
操作系统
开源
桌面环境
aiohere是一个用于处理异步IO操作的Python库
综合
aiohere是一个用于处理异步IO操作的Python库
2024-11-18 11:00:26 +0800 CST
view 1620
aiohere是一个用于处理异步IO操作的Python库,能显著提升网络请求和IO密集型任务的性能。本文介绍了aiohere的安装、基本用法、高级用法及实际案例,包括并发处理和超时设置,帮助开发者高效处理多个请求并获取API数据。掌握aiohere将有助于提升Python异步编程的效率。
Python库
异步编程
网络编程
性能优化
API交互
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
2
下一页