程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
LLM 相关技术文章(第2页)
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
KotlinLLM 开源:把运行时逻辑委托给大模型的 IntelliJ 插件原型
编程
KotlinLLM 开源:把运行时逻辑委托给大模型的 IntelliJ 插件原型
2026-09-07 05:14:05
JetBrains Research 开源 KotlinLLM:IntelliJ 插件让 Kotlin 代码将运行时逻辑委托给大模型,Smart macros 生成并持久化 Kotlin 源码(asLlm/mockLlm),显式、持久、可移植,评估 24/24 场景完成、约 1% 开销。
KotlinLLM
Kotlin
大模型
LLM
IntelliJ
JetBrains
开源
Project HydraFusion:GitHub 多模型编排实现前沿质量的 AI 编码体验
编程
Project HydraFusion:GitHub 多模型编排实现前沿质量的 AI 编码体验
2026-09-07 02:10:39
GitHub 推出 Project HydraFusion 多模型编排方案:将不同编码任务路由到最擅长的模型,组合多个模型优势实现前沿质量。覆盖任务分类、模型路由策略、质量保障、成本延迟控制,以及代码生成、审查、Bug修复等应用场景。
GitHub
多模型编排
AI编码
模型路由
Copilot
LLM
架构设计
解读 AI 编程新术语:Loops、Harnesses、Squads、Hill Climbing 等概念全解析
编程
解读 AI 编程新术语:Loops、Harnesses、Squads、Hill Climbing 等概念全解析
2026-09-07 00:14:42
系统解读 AI 编程领域涌现的新术语:Loop 循环、Harness 框架、Squad 多代理协作、Hill Climbing 爬山法等,阐明各自的技术原理、实际应用和相互关系,帮助开发者理解 AI 编程从代码补全到自主代理的技术演进。
AI编程
LLM
Agent
Loop
Harness
Squad
GitHub Copilot
开发工具
为什么 Token 价格下降了 75%,你的 AI 账单却翻了三倍
编程
为什么 Token 价格下降了 75%,你的 AI 账单却翻了三倍
2026-09-06 15:14:58
Elastic博客探讨矛盾现象:LLM Token价格过去一年下降约75%,但许多企业AI账单增长了2-3倍。根本原因:使用量爆炸式增长(更多用户、更多用例、更频繁调用、更长上下文);Agent多步骤工作流(一个任务5-10次LLM调用,消耗是简单问答10-100倍);上下文膨胀(RAG检索、对话历史、工具结果、系统提示词);输出Token高成本(价格是输入2-5倍);模型选择不当(用大模型处理简单任务);缺乏成本监控和治理。成本控制策略:细粒度监控、优化上下文、模型路由、优化Agent设计、缓存批处理、建立治理流程。综合优化可降低AI账单50%以上。
AI成本
Token价格
LLM
成本优化
Agent
上下文工程
模型路由
成本治理
上下文工程的兴起:为什么它是 AI 工程师最重要的技能
编程
上下文工程的兴起:为什么它是 AI 工程师最重要的技能
2026-09-06 14:11:02
LangChain创始人Harrison Chase提出上下文工程正在成为AI工程师最重要的技能。定义:构建动态系统,以正确格式提供正确信息和工具,使LLM能合理完成任务。大多数Agent表现不可靠的根本原因不是模型能力不足,而是上下文没有正确传达。核心组件包括:系统提示词(角色目标约束)、检索系统(获取相关信息)、工具定义(与外部世界交互)、对话历史管理(多轮上下文)、动态上下文构建(整合所有来源)。LLM应用正从单一提示词演进到复杂Agent系统,上下文工程取代提示词工程成为核心技能。最佳实践:从简单开始、测量和迭代、使用可观测性工具、建立上下文测试套件、文档化设计决策。
上下文工程
LangChain
提示词工程
Harrison Chase
AI Agent
RAG
检索
LLM
LLM 负载测试正在烧光你的 API 预算:为什么缺少原生测试模式是个问题
编程
LLM 负载测试正在烧光你的 API 预算:为什么缺少原生测试模式是个问题
2026-09-06 14:11:01
ForgeWorkflows团队指出LLM负载测试正成为工程团队的隐性成本黑洞。核心问题:没有任何LLM提供商提供原生测试模式,每次调用都消耗真实算力。1000并发用户、每个pipeline 3次LLM调用、10分钟就是180万次API调用,成本让财务团队质疑。web-search multiplier效应:Anthropic的web_search工具每次注入3-4万token,实际成本是估算的2倍。团队目前用mock服务、小模型、限制测试规模、详细成本预测来应对。呼吁提供商提供测试模式:走完HTTP栈但不运行推理、返回合理响应形状、免费或大幅折扣。
LLM
负载测试
API成本
测试模式
OpenAI
Anthropic
成本优化
AI基础设施
AI Agent 延迟优化指南:从诊断瓶颈到并行调用的五个关键策略
编程
AI Agent 延迟优化指南:从诊断瓶颈到并行调用的五个关键策略
2026-09-06 13:09:46
LangChain创始人Harrison Chase系统总结AI Agent延迟优化的五个关键策略。开发者通常先让Agent能工作再转向速度优化。核心是先诊断瓶颈再优化:延迟来自一个大LLM调用还是多个小调用累加?五策略包括:1.识别延迟来源(用LangSmith瀑布图诊断);2.改变UX减少感知延迟(流式输出、乐观UI更新,Perplexity通过显示中间结果大幅降低感知等待);3.减少LLM调用(合并步骤、缓存、用规则替代LLM);4.加速LLM调用(选更快模型、优化提示词);5.并行LLM调用(对独立步骤并行执行)。优化需权衡延迟、质量、成本。
AI Agent
延迟优化
LangChain
LangSmith
LLM
性能优化
流式输出
并行调用
FreeLLMAPI:聚合 34 家免费 LLM 提供商,每月 74 亿 token,一个 OpenAI 兼容端点
编程
FreeLLMAPI:聚合 34 家免费 LLM 提供商,每月 74 亿 token,一个 OpenAI 兼容端点
2026-09-06 10:14:39
FreeLLMAPI是开源免费LLM API聚合器,将34家提供商的免费额度聚合到一个OpenAI兼容/v1端点。每月约74亿token推理容量,覆盖474个模型系列、635个免费端点。核心功能包括智能路由(按任务选模型、速率限制时自动故障转移)、加密密钥存储、自动模型目录更新、多模态支持(embedding/图像/音频)。兼容任何OpenAI客户端和编码Agent(Cursor/Windsurf/Aider等)。适合个人开发者、原型开发、非关键任务和模型比较。免费额度可能变更,模型质量参差不齐。
FreeLLMAPI
LLM
API聚合
免费
OpenAI兼容
智能路由
开源
AI开发
LLM 结构化输出可靠方案:重试-修复循环让解析器永不见到坏 JSON
编程
LLM 结构化输出可靠方案:重试-修复循环让解析器永不见到坏 JSON
2026-09-06 07:16:17
文章分享在真实产品中接入LLM的经验:提示模型返回JSON在Demo中正常,但上线后凌晨2点收到FormatException——模型把JSON包在代码块里、加开场白、尾随逗号。97%正确率的模型每天仍有数千次失败。可靠的结构化输出不是提示词技巧,而是多阶段流水线:结构化提示→提取清理→解析→重试→修复循环(核心创新,将语义错误反馈给模型修复)→Schema验证。文章还介绍了函数调用/JSON Mode、语法约束解码等进阶技术,以及最佳实践和常见陷阱。
LLM
结构化输出
JSON
重试
修复循环
Schema验证
AI工程
函数调用
从 Prompt Engineering 到 AI Engineering:构建可靠 AI 功能的工程范式
编程
从 Prompt Engineering 到 AI Engineering:构建可靠 AI 功能的工程范式
2026-09-06 06:18:23
AI应用开发正经历范式转变:从单纯的提示词工程转向AI工程。文章指出,写提示词在简单低风险场景有效,但生产环境面临上下文管理、工具使用、变更验证、故障调试、输出验证、自主权边界等工程问题。AI工程是软件工程、MLOps、分布式系统、安全、测试、平台工程的组合,核心实践包括上下文工程、评估框架、可观测性、输出验证、容错降级、安全治理,以及RAG、Agent、流水线等架构模式。
AI工程
Prompt Engineering
LLM
RAG
Agent
MLOps
可观测性
评估框架
揭秘 LLM 上下文窗口:AI 记忆如何工作以及为什么会失效
编程
揭秘 LLM 上下文窗口:AI 记忆如何工作以及为什么会失效
2026-09-06 05:13:46
文章深入探讨大语言模型上下文窗口的工作原理和失效原因。介绍了上下文窗口的组成(系统提示词、对话历史、当前输入、生成输出)、工作原理(Token化、注意力机制、位置编码、KV缓存),以及失效的六大原因(中间迷失、注意力稀释、位置编码外推、KV缓存管理、训练数据影响、提示词工程影响)。还提供了改善方法(提示词优化、上下文管理、RAG、微调、选择合适模型)和未来发展方向。
LLM
上下文窗口
Context Window
注意力机制
RAG
大模型
AI记忆
提示工程
前沿 LLM API 价格五个月未动,8 月却变动三次:一家实验室将费率提高了两倍
资讯
前沿 LLM API 价格五个月未动,8 月却变动三次:一家实验室将费率提高了两倍
2026-09-06 03:11:18
前沿LLM API价格在5个月稳定后,8月份发生了三次显著变动:一家实验室降价、另一家调整定价结构、第三家将费率提高两倍。文章分析了价格结构性粘性的原因、三次变动的具体情况和背景,以及对LLM定价趋势的重新思考(价格分化加剧、定价结构灵活化、成本透明度提升、价格战可能到来),并给出了开发者和企业的应对建议。
LLM
API定价
大模型
AI
价格趋势
成本优化
多模型策略
开源模型
Claude Fable 5 与 Opus 4.8:2026 年完整指南
编程
Claude Fable 5 与 Opus 4.8:2026 年完整指南
2026-09-06 02:13:04
Claude Fable 5自2026年6月发布以来成为软件工程团队讨论焦点,被认为是Anthropic最强大的推理引擎。文章详细介绍了Fable 5的核心能力(深度推理/长上下文/工具使用和Agent/代码生成)、技术特点和适用场景,Opus 4.8的核心能力和适用场景,两者的关键差异对比和选择建议,以及使用最佳实践(提示词优化/长上下文使用/工具使用/成本优化)。
Claude
Anthropic
Fable 5
Opus 4.8
大模型
AI
推理
LLM
Tree of Thoughts 与 MCTS 在 LLM 中的应用:当模型不再只猜一次时会发生什么
编程
Tree of Thoughts 与 MCTS 在 LLM 中的应用:当模型不再只猜一次时会发生什么
2026-09-06 02:13:03
传统LLM推理是让模型一次性猜答案,而Tree of Thoughts和MCTS让模型能探索多条推理路径、评估中间结果、选择最优路径。文章详细介绍了ToT的核心思想(思维分解/生成/评估/搜索)、MCTS的四个步骤(选择/扩展/模拟/回溯)、两者的区别和结合方式、实际应用场景(数学推理/代码生成/规划决策/科学发现),以及实现挑战和注意事项。
Tree of Thoughts
MCTS
LLM
推理
蒙特卡洛树搜索
AI
大模型
提示工程
在 3.2GB 显存上微调 1.7B 模型:FineTune Studio 的构建实践
编程
在 3.2GB 显存上微调 1.7B 模型:FineTune Studio 的构建实践
2026-09-05 22:15:52
开发者分享构建 FineTune Studio 的经历——一个让普通人在消费级显卡上微调大语言模型的开源工具。核心技术是 QLoRA(4-bit量化+低秩适配+分页优化器),配合梯度检查点、CPU卸载、8-bit优化器等显存优化技巧,在3.2GB显存上完成1.7B模型微调。
大模型
微调
QLoRA
FineTune Studio
LLM
开源
低显存
AI
我的七个 AI Agent 从不互相通信:为什么 Agent 间协作可能是过度设计
编程
我的七个 AI Agent 从不互相通信:为什么 Agent 间协作可能是过度设计
2026-09-05 21:19:45
开发者分享反直觉经验:运行七个处理同一领域的 AI Agent,但它们从不互相发送消息。最初计划构建协调器和专家 Agent 协作系统,但实际证明大模型已是通才、通信增加复杂性和故障点、共享上下文比消息传递更高效、人类在回路中比 Agent 协作更有效。
AI Agent
多Agent
协作
架构设计
过度设计
LLM
自动化
系统设计
Perceive:为 RAG 流水线构建的 Web 内容提取工具
编程
Perceive:为 RAG 流水线构建的 Web 内容提取工具
2026-09-05 21:19:43
浏览器和大模型看同一个 URL 看到完全不同的东西。开发者分享构建 Perceive 的过程——专门为 RAG 流水线设计的 Web 内容提取工具,采用渲染层、内容识别层、清洗层、结构化保留层和输出层五层架构,解决传统抓取噪音多、动态内容丢失、结构化信息丢失等问题。
RAG
Web抓取
内容提取
Perceive
AI
LLM
信息检索
Python
AI Agent 规模化的经济学:Token、ROI 与平台构建
编程
AI Agent 规模化的经济学:Token、ROI 与平台构建
2026-09-05 20:29:57
当运行几十上百个 AI Agent 时,模型本身很少是瓶颈,真正困难的是用最少上下文获得可靠结果并控制成本。文章探讨 token 经济学、成本结构、ROI 衡量指标和 Agent 平台化的必要性。
AI Agent
大模型
Token
ROI
平台化
成本优化
规模化
LLM
半个月前提的海鲜过敏还能记住:MemOS的Agent记忆存储索引与召回机制
编程
半个月前提的海鲜过敏还能记住:MemOS的Agent记忆存储索引与召回机制
2026-09-05 19:16:15
介绍MemOS这个Agent记忆系统:从操作系统层面重新设计记忆的存储、索引与召回结构。在OmniMemEval统一评测中,Agent Memory和User Memory两条线均表现突出,LoCoMo、LongMemEval等横评均获第一,GitHub Star超10.5K。
MemOS
Agent记忆
记忆系统
LLM
运行 AI Agent 一年后的四条实战经验:别在提示词上死磕
编程
运行 AI Agent 一年后的四条实战经验:别在提示词上死磕
2026-09-05 19:13:32
作者花了一年时间把 AI Agent 接入邮件分类、部署检查、内容流水线等日常工作流,总结出四条真正重要的运维经验:任务简报比提示词重要、审计日志比记忆系统有用、给每个 Agent 独立爆炸半径、自动化验证才是核心功能。
AI Agent
自动化
提示词
运维
工作流
LLM
实践经验
PUAClaw:用学术格式研究AI提示词操控技术的开源文档库,2K Star
编程
PUAClaw:用学术格式研究AI提示词操控技术的开源文档库,2K Star
2026-09-05 18:59:23
介绍 PUAClaw 这个开源项目:用学术论文格式研究如何用话术影响 AI 输出,包含16个技术类别、96项子技术,按温柔劝导、适度施压、高级操控、核武级选项四个层级组织,每项配标准化提示词模板和效力评估,支持多语言,中文为最高优先级翻译,2K Star。
PUAClaw
提示词工程
AI操控
LLM
6 万 Star 的提示工程指南:DAIR.AI 项目目录里有哪些内容
编程
6 万 Star 的提示工程指南:DAIR.AI 项目目录里有哪些内容
2026-09-05 00:41:46
介绍 DAIR.AI 发起的 Prompt Engineering Guide(GitHub 约 6 万 Star),梳理其从基础概念、提示技术、应用、模型到风险与 LLM 研究的完整目录结构,供做提示词工程与 LLM 开发的工程师查阅。
提示工程
LLM
Prompt
DAIR.AI
SKRT:技能库超过 100 个后,先本地路由再读 SKILL.md
编程
SKRT:技能库超过 100 个后,先本地路由再读 SKILL.md
2026-09-05 00:05:01
技能库上百个时全量塞 description 会耗尽 Agent 上下文预算。SKRT 是一个 Go 写的 Skill Router CLI:7 层本地匹配毫秒级圈出 top-N 技能,无 API Key 也可用,配 CJK bigram 与可选 embedding 重排。本文记录安装、配置与边界。
Skill
Router
Agent
LLM
SKILL.md
Gemini
CLI
Claude
Code
Structured Outputs 生产笔记:三个静默失效点
编程
Structured Outputs 生产笔记:三个静默失效点
2026-09-05 00:04:52
OpenAI Structured Outputs 生产排坑笔记:嵌套对象漏写 additionalProperties:false 会让请求静默退回非 strict、optional 字段不能直接从 required 删(要用 null 联合类型)、refusal 与截断仍以 200 成功返回需后端再校验。附带 schema 当接口代码维护的实践。
Structured
Output
JSON
Schema
LLM
接口
response_format
工程排坑
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
python
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
上一页
1
2
3
4
5
6
7
…
12
下一页
共 12 页
到第
页
确定