程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
LLM 相关技术文章
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
把模型和运行时打成一个文件:goinfer 用纯 Go 跑 LLM 推理
编程
把模型和运行时打成一个文件:goinfer 用纯 Go 跑 LLM 推理
2026-09-25 21:05:23
goinfer 把模型权重和推理运行时打进同一个文件,用纯 Go 跑 LLM 推理,不依赖 Python、llama.cpp 或 CUDA 工具链。本文整理项目地址、Go 1.27+ 构建命令、goinstall 带 CUDA/Metal 后端的方式、支持的模型与量化家族、OpenAI/Anthropic 兼容端点,以及 Pre-1.0 阶段加载器接口仍在变动的限制。
Go
LLM
推理
开源项目
GGUF
Model Router:给 Claude Code / Codex CLI 接非 Anthropic 模型,本地代理做三协议互转 + 标签路由
编程
Model Router:给 Claude Code / Codex CLI 接非 Anthropic 模型,本地代理做三协议互转 + 标签路由
2026-09-21 00:04:47
Model Router 是一个桌面端 AI 模型代理:在 Claude Code / Codex CLI 与模型商之间做 Anthropic Messages、OpenAI Chat Completions、OpenAI Responses 三协议互转,支持流式 SSE 与 thinking 块,并用 opus/sonnet/haiku/auto 标签把请求路由到 DeepSeek、Kimi、文心、GLM 等后端,本文给出配置与接管步骤。
Model
Routing
模型路由
协议转换
Claude
Code
Codex
CLI
Anthropic
Messages
LLM
Router
端边云三级路由 + S1/S2/S3 隐私分级:一个 OpenAI 兼容网关怎么决定请求上不上云
编程
端边云三级路由 + S1/S2/S3 隐私分级:一个 OpenAI 兼容网关怎么决定请求上不上云
2026-09-21 00:03:39
以 hybrid-router-oss 为例,讲一个 OpenAI 兼容的端边云混合推理路由网关:如何按 S1/S2/S3 隐私分级决定请求是否上云,用 semantic-router + RouteLLM 两级分类器省掉 LLM-as-Judge,并给出 mock/真实后端两套接入配置与路由策略表。
Model
Routing
模型路由
LLM
Router
AI
Gateway
端边云
隐私路由
自建 LLM 推理引擎:默认 vLLM 之后,什么时候该换 SGLang 或 TensorRT-LLM?
编程
自建 LLM 推理引擎:默认 vLLM 之后,什么时候该换 SGLang 或 TensorRT-LLM?
2026-09-20 00:04:35
自建 LLM 推理引擎的选型与部署边界:vLLM 为什么是默认起点,SGLang 的 RadixAttention 只有前缀命中时才有效,TensorRT-LLM 的编译成本与 NVIDIA 硬件锁定意味着什么,以及为什么横评数字只能当方向性参考、必须自测。
inference
engine
推理引擎
vLLM
SGLang
TensorRT-LLM
LLM
部署
AI
工程
用 Go 构建生产级 AI Agent:Agent SDK Go 的多模型、记忆与 MCP 集成
编程
用 Go 构建生产级 AI Agent:Agent SDK Go 的多模型、记忆与 MCP 集成
2026-09-12 09:54:52
Go 的 AI Agent 框架 Agent SDK Go 拆解:多模型接入(OpenAI/Anthropic/DeepSeek/Ollama 等)、Buffer 与向量记忆、模块化工具与 MCP 集成、Token 成本追踪、安全护栏与可观测性,含可运行代码、agent.yaml 配置与 CLI 用法。
Go
AI
Agent
MCP
LLM
开源框架
LLM 平民化:3 块钱 + 2 小时,从 0 训出 64M 小模型
编程
LLM 平民化:3 块钱 + 2 小时,从 0 训出 64M 小模型
2026-09-10 21:25:21
MiniMind 用约 3 元、2 小时在单卡 3090 上从 0 训出 64M 小语言模型。本文按 README 整理完整链路:数据下载、预训练与 SFT 命令、MoE/RLAIF/Tool Call 训练、词表与 d_model/n_layers 取舍、训练开销与第三方推理部署(llama.cpp/vllm/ollama)。
LLM
MiniMind
PyTorch
模型训练
小语言模型
Ollama v0.34.0 版本解读:ChatGPT 桌面端可用本地模型
编程
Ollama v0.34.0 版本解读:ChatGPT 桌面端可用本地模型
2026-09-10 12:17:52
Ollama v0.34.0(2026-09-09)发布:本地模型可直接在 ChatGPT Desktop 中使用(macOS 应用内设置),Apple Silicon 结构化输出性能提升,新增 OpenAI 兼容客户端工具搜索与响应压缩支持,并修复压缩响应中的图片输出。
Ollama
LLM
本地模型
ChatGPT
OpenAI 兼容
LangGraph 多智能体交易框架 TradingAgents:状态恢复、记忆注入与可复现边界
编程
LangGraph 多智能体交易框架 TradingAgents:状态恢复、记忆注入与可复现边界
2026-09-09 00:03:51
速读 Tauric Research 开源的多智能体 LLM 交易框架 TradingAgents:LangGraph 编排多个专职 agent、SQLite checkpoint 断点续跑、决策记忆回注,以及框架如何界定"两次运行结果不同"的可复现性边界。适合关心多智能体系统工程化落地的工程师。
Tauric
Research
TradingAgents
多智能体
LangGraph
LLM
agent 是五个普通部件的接线:大脑、手、笔记本缺一不可
编程
agent 是五个普通部件的接线:大脑、手、笔记本缺一不可
2026-09-08 07:13:28
agent 没有单一聪明部件:大脑(LLM)、手(工具)、笔记本(记忆)加计划与回报五件套,智能在接线方式里;能力上限由工具集决定。
AI
Agent
LLM
架构
从 prompt 到收款:把 LLM 链路接进真实零工平台
编程
从 prompt 到收款:把 LLM 链路接进真实零工平台
2026-09-08 06:11:17
Gig Platform + Agent Frontend + LLM Orchestrator 三层架构:webhook 收 job、LangChain 跑链、x402 按工作单元收费,同步响应跑通再换轮询。
AI
LLM
自动化
架构
PII 与注入双检测的亚毫秒方案:Rust 三层复合打分
编程
PII 与注入双检测的亚毫秒方案:Rust 三层复合打分
2026-09-08 06:11:16
promptfirewall 无 NER 无 ML:正则加 Luhn/ISO 7064 校验消 PII 误报,启发式+TF-IDF+熵三层复合打分抓注入;完整扫描 11.9 微秒。
Rust
安全
LLM
开源
OTel processor 按成本采样:LLM 可观测性账单省下 1.2 万美元/月
编程
OTel processor 按成本采样:LLM 可观测性账单省下 1.2 万美元/月
2026-09-08 06:11:12
随机 1% 采样对成本无感:$2.50 的 trace 与 $0.001 的同等被丢;TraceShrink 按整条 trace 聚合成本采样,OTTL 做不到跨 span 聚合。
OTel
可观测性
LLM
成本
楼宇自动化里部署 LLM agent:66 篇研究的部署就绪度地图
编程
楼宇自动化里部署 LLM agent:66 篇研究的部署就绪度地图
2026-09-08 05:08:51
66 篇 HVAC-LLM 综述:点命名归一化是近期可用场景,控制与优化仍是研究级;无一项达到持续运营部署,agent 输出必须人工复核。
AI
LLM
综述
应用
你的 system prompt 不是指令,是数据
编程
你的 system prompt 不是指令,是数据
2026-09-08 03:08:17
本地 31B 模型的 A/B 实证:模型把 system prompt 当输出附近的文本样本读;禁止短语要删不要禁;位置胜措辞、具体胜原则、三颗种子验证。
AI
LLM
Prompt
实践
推理强度参数实测:更高档位不等于更好答案,只等于更贵
编程
推理强度参数实测:更高档位不等于更好答案,只等于更贵
2026-09-08 01:11:24
GPT-6 Astra reasoning_effort 实测:max 比 low 贵 2.3 倍且 11 个任务答案相同;none 清零思考 tokens 但失败过半;基准按最高档报告,读发布数据要看清档位。
AI
LLM
定价
评测
Temperature 0 并不确定性:为什么你的 LLM 结果仍会漂移
编程
Temperature 0 并不确定性:为什么你的 LLM 结果仍会漂移
2026-09-08 01:11:21
temperature=0 只保证贪心采样,不保证 logits 相同:GPU reduction 顺序随 batch 形状变化导致最后一位舍入漂移,近并列 token 被自回归放大,修复测试而非数学。
AI
LLM
测试
实践
开放权重 LLM 与前沿 API:什么时候租,什么时候拥有
编程
开放权重 LLM 与前沿 API:什么时候租,什么时候拥有
2026-09-07 23:12:37
自托管开放权重模型与前沿 API 的决策框架:成本交叉点、延迟与数据驻留的硬理由、Own/Rent 决策清单,以及微调用生产轨迹才是真正护城河的 FAQ。
AI
LLM
架构
决策
cloudwego/eino:用 Go 写 LLM Agent,从 ChatModelAgent 到图编排与中断恢复
编程
cloudwego/eino:用 Go 写 LLM Agent,从 ChatModelAgent 到图编排与中断恢复
2026-09-07 21:33:38
介绍 cloudwego/eino:Go 生态的 LLM 应用开发框架(Apache-2.0)。讲清 ChatModelAgent、DeepAgent、compose 图编排、流式处理、回调切面与 human-in-the-loop 中断恢复这几块能干什么、适合什么场景,附上手代码与官方/组件/示例仓库链接。
Go
LLM
Agent
cloudwego
eino
AI框架
langchain
自托管 LLM 防火墙:给 OpenAI 兼容端点加 RBAC、策略过滤与多 Provider 路由
编程
自托管 LLM 防火墙:给 OpenAI 兼容端点加 RBAC、策略过滤与多 Provider 路由
2026-09-07 17:12:12
把 LLM 端点暴露给用户的风险:prompt injection、数据泄漏、无访问控制。Resk 提供自托管防火墙:JWT + 64 位能力位掩码 RBAC、token 级策略过滤、多 provider 路由与全量日志。
AI
安全
LLM
网关
自托管
AI 资助搜索器不信任自己的模型:FundFinderAI 的防幻觉工程
编程
AI 资助搜索器不信任自己的模型:FundFinderAI 的防幻觉工程
2026-09-07 15:19:10
FundFinderAI 用 Gemini 搜索真实开放资助,但拒绝信任模型输出:每个 URL 独立验证、grounding 可运行检查、搜索结果显示而非引用、broken 与 unverified 刻意不对称。
AI
LLM
防幻觉
工程实践
从 prompt 到 paycheck:把 LLM 链接入真实外包平台
编程
从 prompt 到 paycheck:把 LLM 链接入真实外包平台
2026-09-07 14:19:45
自主 agent 在外包平台赚钱的实现拆解:划定技能边界、prompt 模板加 LLM 链、webhook 接入平台、x402 协议用 USDC 结算。含完整 Python 代码与限流、token、存储等工程要点。
AI
agent
LLM
自动化
API
更好的模型改善了数字,但没有修复产品
编程
更好的模型改善了数字,但没有修复产品
2026-09-07 13:13:25
四模型对照实验:换更强的云模型让解析近乎完美、通过率上升,但安全语料上每个模型仍大量失败。结论是差距不在模型质量而在产品判断——何时提取、何时拒绝、何时沉默。
AI
LLM
模型评估
工程实践
LLM API 接入工程实践:选型、定价与缓存设计
编程
LLM API 接入工程实践:选型、定价与缓存设计
2026-09-07 09:50:44
从 token 定价到语义缓存:LLM API 选型、四种接入模式与集成机制,以及提示词缓存、语义缓存、限流重试与会话状态等外围工程的完整实践指南。
LLM
API
Redis
语义缓存
上线前如何评估 LLM:GitHub 在生产前评估大模型的实践方法
编程
上线前如何评估 LLM:GitHub 在生产前评估大模型的实践方法
2026-09-07 06:13:25
GitHub 分享上线前评估 LLM 的五个实践:从产品决策开始而非模型、离线评估当作集成测试、一次只改一个变量、评估贴近生产、生产标签只当信号,核心是产生支撑产品决策的证据。
LLM
模型评估
生产环境
秘密扫描
提示词
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
python
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
上一页
1
2
3
4
5
6
7
…
12
下一页
共 12 页
到第
页
确定