程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
Kimi K2 系列深度实战:月之暗面开源编码大模型架构解析与生产级部署完全指南
编程
Kimi K2 系列深度实战:月之暗面开源编码大模型架构解析与生产级部署完全指南
2026-06-28 03:15:43 +0800 CST
view 744
深度解析月之暗面Kimi K2系列(K2.5/K2.6/K2.7 Code)的MoE架构、多模态能力、Token优化策略,附Ollama本地部署、OpenRouter API集成、OpenCode实战及Agent工作流完整代码。
Kimi K2
月之暗面
MoE架构
编码大模型
AI编程
Token优化
本地部署
OpenRouter
多模态
Agent工作流
Google I/O 2026 深度解析:Gemini 3.5 Flash 横空出世,Agent 时代的计算范式革命
编程
Google I/O 2026 深度解析:Gemini 3.5 Flash 横空出世,Agent 时代的计算范式革命
2026-05-21 18:57:35 +0800 CST
view 1209
2026年5月Google I/O大会发布Gemini 3.5 Flash,输出速度289 token/s达竞品4倍,免费开放,标志AI从被动应答进入Agent自主执行新时代。本文从技术架构、性能基准、工程实践三维度深度解析。
Google I/O 2026
Gemini 3.5 Flash
Agent
AI
大模型
多模态
MiniMax H3 开源视频模型架构深度拆解:从 Contextual Omni Representation 到 H3-Omni Transformer 的全链路工程解析
编程
MiniMax H3 开源视频模型架构深度拆解:从 Contextual Omni Representation 到 H3-Omni Transformer 的全链路工程解析
2026-08-11 14:32:39 +0800 CST
view 286
深度拆解 MiniMax H3 开源视频模型三层模块架构:Contextual Omni Representation、H3-Omni Transformer、H3-VAE,以及 FL2VA 与 Ref2VA 的技术差异、INT8 量化优化与本地部署实战
MiniMax H3
视频生成
开源AI
扩散模型
多模态
H3-Omni Transformer
百度 Unlimited OCR 深度技术解析:端到端多模态OCR模型架构与R-SWA注意力机制详解
编程
百度 Unlimited OCR 深度技术解析:端到端多模态OCR模型架构与R-SWA注意力机制详解
2026-07-05 02:43:03 +0800 CST
view 377
深入解析百度Unlimited OCR的核心技术:R-SWA注意力机制如何将KV Cache压成常数,DeepEncoder+MoE解码器架构,以及长文档OCR的完整解决方案。
OCR
百度
深度学习
Transformer
KV Cache
端到端
多模态
文档解析
GPT-6「土豆」深度解析:当「交响乐」架构敲响AGI大门
编程
GPT-6「土豆」深度解析:当「交响乐」架构敲响AGI大门
2026-04-09 08:47:06 +0800 CST
view 1230
深度解析OpenAI GPT-6代号「土豆」的技术突破:Symphony原生多模态统一架构、5-6万亿MoE参数、200万Token上下文窗口、System-2双系统推理引擎。探讨其对AI Agent生态的影响。约12000字。
GPT-6
OpenAI
AGI
Symphony
MoE
多模态
上下文窗口
System-2
Agent
百度 Unlimited OCR 深度解析:端到端架构、R-SWA 常数量化 KV Cache,以及让 AI 像人一样抄书的工程革命
编程
百度 Unlimited OCR 深度解析:端到端架构、R-SWA 常数量化 KV Cache,以及让 AI 像人一样抄书的工程革命
2026-07-05 05:41:29 +0800 CST
view 426
深度解析百度2026年开源的Unlimited OCR模型:端到端架构、R-SWA常数量化KV Cache机制、MoE解码器设计,以及让AI像人一样连续解析长文档的工程革命。含完整代码实战。
OCR
百度
端到端OCR
R-SWA
KV Cache
文档识别
多模态
RAG-Anything 深度解析:19K Star 的多模态 RAG 终极解决方案,让 AI 真正读懂图文表公式
编程
RAG-Anything 深度解析:19K Star 的多模态 RAG 终极解决方案,让 AI 真正读懂图文表公式
2026-04-28 21:16:14 +0800 CST
view 909
深度解析 GitHub 19K Star 的 RAG-Anything 多模态 RAG 框架:All-in-One 架构设计、MinerU 文档解析、多模态知识图谱、向量-图谱融合检索,完整覆盖从原理到生产部署的技术细节。
RAG
多模态
知识图谱
LightRAG
MinerU
AI
向量检索
文档处理
编程
RAG-Anything 深度实战:把PDF里的图表公式全塞进知识图谱——港大HKUDS实验室如何重新定义多模态RAG
2026-05-16 12:46:25 +0800 CST
view 745
RAG-Anything是港大HKUDS实验室开源的多模态RAG框架,能把PDF里的文字、图片、表格、公式全部塞进知识图谱。本文深度剖析其核心技术和实战应用。
RAG
多模态
知识图谱
PDF处理
GitHub Trending
英伟达Nemotron 3 Nano Omni:一个模型搞定看听读写,智能体效率狂飙9倍
编程
英伟达Nemotron 3 Nano Omni:一个模型搞定看听读写,智能体效率狂飙9倍
2026-05-01 04:40:16 +0800 CST
view 837
英伟达发布Nemotron 3 Nano Omni开源多模态模型,30B-A3B MoE架构,统一视觉音频语言编码,吞吐量9倍提升,六大排行榜榜首,富士康甲骨文等已采用。
英伟达
多模态
开源
AI智能体
Nemotron
视觉即代码:GLM-5V-Turbo 如何用 94.8 分重新定义 Design2Code
编程
视觉即代码:GLM-5V-Turbo 如何用 94.8 分重新定义 Design2Code
2026-05-11 09:52:48 +0800 CST
view 851
智谱AI发布GLM-5V-Turbo多模态编程基座模型,从预训练阶段原生融合视觉与语言,在Design2Code基准测试中以94.8分超越所有竞品。本文深度解析CogViT视觉编码器、MMTP多模态多Token预测、多任务RL优化等技术细节,以及如何用API接入实现从设计稿到可运行代码的完整工作流。
GLM-5V-Turbo
视觉编程
Design2Code
多模态
CogViT
MMTP
智谱AI
AI编程
Apache Flink 3.0 深度解析:从实时计算引擎到 Agent Native 基础设施——Agentic Streaming、Flink Agents 与多模态数据湖的完整实战指南
编程
Apache Flink 3.0 深度解析:从实时计算引擎到 Agent Native 基础设施——Agentic Streaming、Flink Agents 与多模态数据湖的完整实战指南
2026-07-06 06:42:31 +0800 CST
view 662
深度解析Apache Flink 3.0 Agent Native架构:从Cloud Native到Agent Native的范式转换、Agentic Streaming流水线架构、Flink Agents事件驱动智能体框架、Apache Paimon 2.0多模态数据湖、Apache Fluss 1.0实时上下文层与MCP Gateway、CPU+GPU混合调度、淘宝闪购与小红书生产实战。含Java/Python完整代码示例。
Apache Flink
Flink Agents
Agent Native
Agentic Streaming
实时计算
AI Agent
多模态数据湖
Apache Paimon
Apache Fluss
Open Notebook 深度实战:当开源替代方案击败 Google Notebook LM——从多模态RAG到自托管部署的生产级完全指南(2026)【上】
编程
Open Notebook 深度实战:当开源替代方案击败 Google Notebook LM——从多模态RAG到自托管部署的生产级完全指南(2026)【上】
2026-06-11 16:20:00 +0800 CST
view 693
Open Notebook 是 Google Notebook LM 的开源替代方案,支持18+ AI模型、多模态内容处理、播客生成。本文上篇深度剖析项目背景、架构设计与核心功能实现。
Open Notebook
Notebook LM 替代品
RAG
多模态
自托管
AI笔记工具
JoyAI-Video-Edit 深度拆解:当京东决定「让视频边播边改」——从流式推理引擎到帧级实时编辑,一个今天刚开源的模型如何用「720P/30fps」重新定义视频创作的终极形态
编程
JoyAI-Video-Edit 深度拆解:当京东决定「让视频边播边改」——从流式推理引擎到帧级实时编辑,一个今天刚开源的模型如何用「720P/30fps」重新定义视频创作的终极形态
2026-08-05 16:46:18 +0800 CST
view 219
深度拆解京东开源的实时流式视频编辑模型JoyAI-Video-Edit:720P/30fps实时推理、滑动窗口注意力机制、帧间一致性约束、四大编辑能力(全局风格/局部替换/局部删除/字幕编辑),OpenVE-Bench全面领先,覆盖电商直播到具身智能的完整应用生态
JoyAI-Video-Edit
京东
视频编辑
流式推理
Diffusion Transformer
实时编辑
OpenVE-Bench
开源
AI视频
多模态
Qwen3.7-Plus 深度实战:11 小时自主开发 APP 的多模态智能体——从 Hybrid-Agent 架构到 GUI 自动化闭环的完全指南(2026)
编程
Qwen3.7-Plus 深度实战:11 小时自主开发 APP 的多模态智能体——从 Hybrid-Agent 架构到 GUI 自动化闭环的完全指南(2026)
2026-06-03 11:16:02 +0800 CST
view 721
深入解析阿里Qwen3.7-Plus多模态智能体模型,从Hybrid-Agent架构设计到代码实战,手把手搭建全自主AI开发系统
AI
Qwen
智能体
多模态
Hybrid-Agent
Agent TARS 深度解析:字节跳动开源的「视觉-行动」双引擎 GUI Agent——从 UI-TARS 模型架构到计算机控制的完整技术内幕
编程
Agent TARS 深度解析:字节跳动开源的「视觉-行动」双引擎 GUI Agent——从 UI-TARS 模型架构到计算机控制的完整技术内幕
2026-05-17 14:14:17 +0800 CST
view 966
深入解析字节跳动开源的 Agent TARS / UI-TARS-Desktop 多模态 GUI Agent 技术栈,从底层视觉语言模型到三层感知-规划-执行 Pipeline,配详细代码示例和实战案例。
AI Agent
GUI自动化
字节跳动
多模态
UI-TARS
计算机视觉
VLM
MCP
Python
Vision-Agents 深度实战:用Stream构建多模态AI Agent——从实时视频理解到边缘计算低延迟的完全指南(2026)
编程
Vision-Agents 深度实战:用Stream构建多模态AI Agent——从实时视频理解到边缘计算低延迟的完全指南(2026)
2026-06-03 15:17:28 +0800 CST
view 706
深入解析 GetStream 开源的 Vision-Agents 框架,从架构设计、视频处理管道、多模态LLM集成、RAG知识库、MCP工具调用到Kubernetes生产部署的完整实战指南
Vision-Agents
GetStream
多模态AI
视频AI
Agent
WebRTC
低延迟
RAG
Seedance 2.0 Skill OS:AI电影制作人的四模态生产流水线,中英日韩多语言支持
编程
Seedance 2.0 Skill OS:AI电影制作人的四模态生产流水线,中英日韩多语言支持
2026-06-25 18:14:15 +0800 CST
view 417
Seedance 2.0 Skill OS:模块化Agent Skill包,让AI像导演一样驾驭Seedance 2.0视频生成。四模态支持(文本/图像/视频/音频),28子技能+57参考文档+114验证用例,中英日韩俄西六语种原生路径,专业电影制作流程(treatment到交付QC),Volcengine/BytePlus/Runway多平台支持。
Seedance 2.0
AI视频生成
开源
Agent Skill
四模态
电影制作
MCP
多语言
Google把操作电脑塞进Gemini 3.5 Flash了
编程
Google把操作电脑塞进Gemini 3.5 Flash了
2026-06-25 20:56:55 +0800 CST
view 574
Google正式将计算机操作能力原生集成进Gemini 3.5 Flash——模型现在可以看屏幕截图、理解当前界面,并给出下一步操作建议(点击按钮、输入文字、滚动页面、完成表单、检查网页流程)。这不是简单的功能更新,而是AI Agent从聊天走向真正干活的关键一步。不依赖固定选择器,像人一样看界面、理解上下文、做出判断。
Gemini 3.5 Flash
Google
AI Agent
计算机操作
自动化测试
浏览器自动化
多模态
UI-TARS-Desktop 深度解析:ByteDance 如何用多模态 AI Agent 重新定义 GUI 自动化
编程
UI-TARS-Desktop 深度解析:ByteDance 如何用多模态 AI Agent 重新定义 GUI 自动化
2026-05-12 04:43:13 +0800 CST
view 1292
UI-TARS-Desktop 是 ByteDance 开源的多模态 AI Agent 技术栈,包含 Agent TARS CLI/Web UI 和 UI-TARS-Desktop 原生应用。支持自然语言控制电脑、视觉理解界面、MCP 工具集成、Event Stream 协议驱动的 Context Engineering。本文深入解析其架构设计、核心特性、实战案例、性能基准与部署最佳实践。
UI-TARS
ByteDance
GUI自动化
多模态AI
MCP
当AI第一次"长出眼睛":o3/o4-mini视觉推理架构深度拆解,从TIR思维中间表示到Codex CLI的视觉编程革命
编程
当AI第一次"长出眼睛":o3/o4-mini视觉推理架构深度拆解,从TIR思维中间表示到Codex CLI的视觉编程革命
2026-07-13 09:15:10 +0800 CST
view 244
深度拆解o3/o4-mini视觉推理核心架构:TIR思维中间表示、空间关系图谱、符号化操作序列、双编码器-解码器架构,配Codex CLI完整实战代码与性能优化指南。
o3
o4-mini
视觉推理
TIR
Codex CLI
OpenAI
多模态
AI编程
万字深度解析百度 Unlimited-OCR:当端到端OCR遇见R-SWA革命,从逐页失忆到40页文档一口气解析(2026)
编程
万字深度解析百度 Unlimited-OCR:当端到端OCR遇见R-SWA革命,从逐页失忆到40页文档一口气解析(2026)
2026-07-02 10:46:07 +0800 CST
view 330
深度解析百度2026年开源的Unlimited-OCR模型:3B参数的端到端OCR系统,R-SWA机制实现常数级KV缓存,OmniDocBench 93.92% SOTA评分,可一口气解析40页文档
Unlimited-OCR
百度
OCR
R-SWA
MoE
CLIP
端到端
长文档处理
深度学习
多模态
R-SWA如何让OCR「过目不忘」:百度Unlimited-OCR的KV缓存革命与40页长文档解析实战(2026)
编程
R-SWA如何让OCR「过目不忘」:百度Unlimited-OCR的KV缓存革命与40页长文档解析实战(2026)
2026-07-02 10:47:12 +0800 CST
view 437
深度解析百度2026年开源的Unlimited-OCR模型:3B参数的端到端OCR系统,R-SWA机制实现常数级KV缓存,OmniDocBench 93.92% SOTA评分,可一口气解析40页文档
Unlimited-OCR
百度
OCR
R-SWA
MoE
CLIP
端到端
长文档处理
深度学习
多模态
MiniCPM-V 4.6:参数砍到1.3B,多模态小钢炮拿下同级第一
编程
MiniCPM-V 4.6:参数砍到1.3B,多模态小钢炮拿下同级第一
2026-05-13 17:38:45 +0800 CST
view 844
面壁智能发布MiniCPM-V 4.6,参数量仅1.3B,1B级多模态评测第一。仅用Qwen3.5-0.8B的2.5%token量即超越对方。LLaVA-UHD v4架构创新,视觉编码运算量降低55.8%,手机断网秒级响应。
MiniCPM-V
面壁智能
多模态
端侧AI
密度定律
MiniCPM-V 4.6 手机实测:1.3B参数跑满端侧推理,输入框还没缩回结果就出来了
编程
MiniCPM-V 4.6 手机实测:1.3B参数跑满端侧推理,输入框还没缩回结果就出来了
2026-05-13 17:56:16 +0800 CST
view 757
MiniCPM-V 4.6手机实测体验:输入框还没缩回结果就出来了。1.3B参数推理版token消耗仅为Qwen3.5-0.8B的1/43,TTFT高清大图75.7ms快2.2倍,LLaVA-UHD v4架构视觉编码运算量降低55.8%。
MiniCPM-V
面壁智能
端侧AI
手机AI
多模态
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
2
3
4
...
19
下一页