一、什么是 OpenAI Python 库?
1.1 一句话定义
openai 是 OpenAI 公司官方发布的 Python 客户端库。它把所有与 OpenAI 服务器通信的底层细节(HTTP 请求、身份验证、JSON 解析、错误重试、流式传输)全部封装好了,让你只需要写几行 Python 代码,就能调用 GPT、DALL·E、Whisper 等顶级 AI 模型。
1.2 生活比喻
┌─────────────────────────────────────────────────────────────────────┐│ ││ 没有 openai 库(直接写 HTTP 请求): ││ → 相当于你自己造一辆车去目的地 ││ → 要自己组装引擎、轮子、方向盘(写 URL、Header、Body) ││ → 还要自己处理抛锚(错误处理)、加油(Token 管理) ││ ││ 有 openai 库: ││ → 相当于你打了一辆出租车 ││ → 你只需要说"去哪里"(传参数) ││ → 司机(库)帮你处理一切驾驶细节 ││ ││ 你的 Python 程序 ││ │ ││ │ client.chat.completions.create(...) ││ ▼ ││ openai 库(帮你组装请求、发送、接收、解析) ││ │ ││ │ HTTPS POST → api.openai.com ││ ▼ ││ OpenAI 服务器(运行 GPT/DALL-E/Whisper 模型) ││ │ ││ │ 返回 JSON 响应 ││ ▼ ││ openai 库(帮你解析 JSON → Python 对象) ││ │ ││ ▼ ││ 你拿到结果:response.choices[0].message.content ││ │└─────────────────────────────────────────────────────────────────────┘
1.3 openai 库能做什么?(功能全景图)
| | |
|---|
| 文本生成 | | |
| 图像生成 | | |
| 图像编辑 | | |
| 嵌入向量 | | |
| 语音转文字 | | |
| 文字转语音 | | |
| 微调 | | |
| 助手 | | |
| 函数调用 | | |
1.4 openai 库 vs 直接用 requests
# ============ 方式1:直接用 requests(麻烦) ============import requestsimport jsonurl = "https://api.openai.com/v1/chat/completions"headers = { "Authorization": "Bearer sk-你的密钥", "Content-Type": "application/json",}body = { "model": "gpt-3.5-turbo", "messages": [{"role": "user", "content": "你好"}], "temperature": 0.7,}response = requests.post(url, headers=headers, json=body, timeout=60)if response.status_code == 200: data = response.json() reply = data["choices"][0]["message"]["content"] print(reply)elif response.status_code == 429: print("请求太频繁,请稍后重试")elif response.status_code == 401: print("密钥无效")elif response.status_code == 500: print("服务器错误")# ... 还要处理流式、重试、超时等各种情况# ============ 方式2:用 openai 库(简洁) ============from openai import OpenAIclient = OpenAI()response = client.chat.completions.create( model="gpt-3.5-turbo", messages=[{"role": "user", "content": "你好"}],)print(response.choices[0].message.content)# 对比:# - 不需要手动拼 URL# - 不需要手动设置 Header# - 不需要手动解析 JSON# - 不需要手动处理各种 HTTP 状态码# - 自带类型提示(IDE 自动补全)# - 自带重试机制
二、安装与环境配置
2.1 安装
# 基础安装pip install openai# 验证安装python -c "import openai; print(openai.__version__)"# 输出:1.35.x(确保是 1.x 版本!)# ⚠️ 注意:openai 库在 2023 年底发布了 v1.0 大版本更新# 旧版语法(openai.ChatCompletion.create)已废弃# 新版语法(client.chat.completions.create)是当前标准# 如果你跟着旧教程学,代码会报错!
2.2 获取 API Key
步骤:1. 访问 https://platform.openai.com2. 注册/登录账号3. 点击左侧菜单 "API Keys"4. 点击 "Create new secret key"5. 复制生成的密钥(格式:sk-proj-xxxxxxxx)6. ⚠️ 只显示一次!务必保存好!
2.3 配置 API Key(三种方式)
# ============ 方式1:环境变量(最推荐!) ============# 在终端设置(Linux/macOS):# export OPENAI_API_KEY="sk-proj-你的密钥"# 在终端设置(Windows CMD):# set OPENAI_API_KEY=sk-proj-你的密钥# 在终端设置(Windows PowerShell):# $env:OPENAI_API_KEY="sk-proj-你的密钥"# Python 代码中直接创建 client(自动读取环境变量)from openai import OpenAIclient = OpenAI() # 自动从 OPENAI_API_KEY 环境变量读取# ============ 方式2:直接传入(仅测试用!) ============from openai import OpenAIclient = OpenAI(api_key="sk-proj-你的密钥")# ⚠️ 绝对不要把密钥提交到 Git!# ============ 方式3:用 .env 文件(项目推荐) ============# 1. 安装:pip install python-dotenv# 2. 在项目根目录创建 .env 文件:# OPENAI_API_KEY=sk-proj-你的密钥# 3. 在 .gitignore 中添加 .env(防止提交到 Git)# 4. Python 代码:from dotenv import load_dotenvimport osload_dotenv() # 自动加载 .env 文件from openai import OpenAIclient = OpenAI(api_key=os.getenv("OPENAI_API_KEY"))
2.4 Client 对象详解
from openai import OpenAI# Client 是所有 API 调用的入口client = OpenAI( api_key="sk-proj-xxx", # API 密钥 base_url="https://api.openai.com/v1", # API 地址(默认值) timeout=60.0, # 请求超时(秒) max_retries=2, # 失败自动重试次数)# 如果你用的是代理/中转服务,修改 base_url:# client = OpenAI(# api_key="sk-xxx",# base_url="https://your-proxy.com/v1"# )# Client 对象包含所有功能模块:# client.chat → 对话补全# client.images → 图像生成# client.embeddings → 文本嵌入# client.audio → 语音处理# client.files → 文件管理# client.fine_tuning → 微调# client.beta → 助手(Assistants)# client.models → 模型列表
三、核心概念详解
3.1 Token(词元)—— 计费单位
# Token 是 AI 处理文本的最小单位# 英文:大约 1 个单词 ≈ 1~1.5 个 token# 中文:大约 1 个汉字 ≈ 1.5~2 个 token# 标点、空格也算 token# 例子:"Hello world" → 约 2 个 token"你好,世界" → 约 5 个 token"Python是一种编程语言" → 约 10 个 token# Token 影响:# 1. 费用:按 input_tokens + output_tokens 计费# 2. 上下文窗口:模型一次能处理的最大 token 数# - GPT-3.5-turbo:约 16K tokens# - GPT-4:约 128K tokens# - GPT-4o:约 128K tokens# 查看一次请求消耗了多少 token:response = client.chat.completions.create( model="gpt-3.5-turbo", messages=[{"role": "user", "content": "你好"}])print(response.usage)# CompletionUsage(prompt_tokens=9, completion_tokens=12, total_tokens=21)print(f"输入:{response.usage.prompt_tokens} tokens")print(f"输出:{response.usage.completion_tokens} tokens")print(f"总计:{response.usage.total_tokens} tokens")
3.2 Model(模型)—— AI 的大脑
# 查看可用模型列表from openai import OpenAIclient = OpenAI()models = client.models.list()for model in models.data: print(model.id)# 常用模型对比:# ┌──────────────────┬──────────┬──────────┬──────────────────┐# │ 模型名称 │ 速度 │ 智能 │ 适用场景 │# ├──────────────────┼──────────┼──────────┼──────────────────┤# │ gpt-4o │ 快 │ 最强 │ 复杂推理、多模态 │# │ gpt-4o-mini │ 最快 │ 较强 │ 日常对话、轻量任务│# │ gpt-4-turbo │ 中 │ 很强 │ 长文本、代码 │# │ gpt-3.5-turbo │ 快 │ 一般 │ 简单任务、低成本 │# │ dall-e-3 │ 慢 │ - │ 图像生成 │# │ whisper-1 │ 中 │ - │ 语音转文字 │# │ tts-1 │ 快 │ - │ 文字转语音 │# └──────────────────┴──────────┴──────────┴──────────────────┘
3.3 Temperature(温度)—— 控制创造力
# temperature 控制输出的随机性/创造性# 范围:0.0 ~ 2.0# temperature = 0:# → 最确定性的输出,每次几乎一样# → 适合:事实问答、代码生成、数据提取# temperature = 0.7(默认):# → 平衡创造力和准确性# → 适合:日常对话、写作# temperature = 1.0~2.0:# → 最随机、最有创意# → 适合:头脑风暴、诗歌、故事创作# 示例对比:from openai import OpenAIclient = OpenAI()prompt = "给一只猫取个名字"# 低温度 → 保守、常见response = client.chat.completions.create( model="gpt-3.5-turbo", messages=[{"role": "user", "content": prompt}], temperature=0.1)print(f"低温(0.1):{response.choices[0].message.content}")# 可能输出:"小花"、"咪咪"(很常见)# 高温度 → 创意、独特response = client.chat.completions.create( model="gpt-3.5-turbo", messages=[{"role": "user", "content": prompt}], temperature=1.5)print(f"高温(1.5):{response.choices[0].message.content}")# 可能输出:"量子毛球"、"薛定谔的喵酱"(很独特)
3.4 max_tokens —— 控制输出长度
# max_tokens 限制模型最多生成多少个 token# 注意:这不是"必须生成这么多",而是"最多生成这么多"response = client.chat.completions.create( model="gpt-3.5-turbo", messages=[{"role": "user", "content": "写一首关于春天的诗"}], max_tokens=50 # 最多输出约25个汉字)# 模型可能在 50 token 内就写完了,也可能被截断
四、文本生成(Chat Completions)⭐ 最核心功能
4.1 消息结构详解
# messages 是一个列表,每个元素是一个字典# 必须包含 "role" 和 "content" 两个键messages = [ # system:设定 AI 的身份、规则、限制(可选但强烈推荐) { "role": "system", "content": "你是一位资深Python程序员,回答简洁明了,代码必须有注释。" }, # user:用户的输入 { "role": "user", "content": "如何读取CSV文件?" }, # assistant:AI 之前的回复(多轮对话时需要) { "role": "assistant", "content": "使用 pandas 库:\nimport pandas as pd\ndf = pd.read_csv('data.csv')" }, # user:用户的新问题 { "role": "user", "content": "如果文件是GBK编码怎么办?" },]
4.2 三种角色的作用
# ============ system(系统提示) ============# 作用:设定 AI 的"人设"和行为规则# 特点:优先级最高,AI 会优先遵守 system 的指令# 比喻:给演员的"角色说明书"{"role": "system", "content": "你是一个严厉但公正的数学老师"}{"role": "system", "content": "你只能用中文回答,每次回答不超过100字"}{"role": "system", "content": "你是JSON格式化助手,只输出JSON,不输出其他任何文字"}# ============ user(用户消息) ============# 作用:用户的提问、指令、输入# 比喻:观众对演员说的话{"role": "user", "content": "帮我写一个排序算法"}{"role": "user", "content": "把这段话翻译成英文:今天天气真好"}# ============ assistant(AI回复) ============# 作用:记录 AI 之前说过的话(提供上下文)# 比喻:演员之前说过的台词(让演员记住自己说了什么){"role": "assistant", "content": "好的,这是冒泡排序的实现..."}
4.3 最简单的完整示例
from openai import OpenAI# 第1步:创建客户端client = OpenAI()# 第2步:调用 APIresponse = client.chat.completions.create( model="gpt-3.5-turbo", # 使用哪个模型 messages=[ # 对话内容 {"role": "user", "content": "1+1等于几?"} ],)# 第3步:提取回复# response 的结构:# response# ├── .id → 请求唯一ID# ├── .model → 实际使用的模型# ├── .choices → 回复列表(通常只有1个)# │ └── [0]# │ ├── .message → 消息对象# │ │ ├── .role → "assistant"# │ │ └── .content → 回复文本 ⭐ 这是你要的!# │ ├── .finish_reason → 结束原因(stop/length)# │ └── .index → 索引# ├── .usage → token 用量# │ ├── .prompt_tokens → 输入 token 数# │ ├── .completion_tokens → 输出 token 数# │ └── .total_tokens → 总 token 数# └── .created → 时间戳reply = response.choices[0].message.contentprint(reply) # "1+1等于2。"# 查看 token 消耗print(f"消耗 {response.usage.total_tokens} 个 token")
4.4 带 system 提示的示例
from openai import OpenAIclient = OpenAI()# 场景:让 AI 扮演一个翻译官response = client.chat.completions.create( model="gpt-3.5-turbo", messages=[ { "role": "system", "content": """你是一个专业的中英翻译官。规则:1. 如果用户输入中文,翻译成英文2. 如果用户输入英文,翻译成中文3. 只输出翻译结果,不要解释4. 保持原文的语气和风格""" }, { "role": "user", "content": "今天的会议推迟到下午三点" } ], temperature=0.3, # 翻译需要准确,温度低一些)print(response.choices[0].message.content)# "Today's meeting has been postponed to 3 PM."
4.5 多轮对话(带记忆)
from openai import OpenAIclient = OpenAI()# 关键:把整个对话历史都传给 API# AI 本身没有记忆!每次调用都是独立的!# 所谓的"记忆"就是你把之前的对话都传进去# 第1轮对话messages = [ {"role": "system", "content": "你是一个友好的助手,回答简洁。"}, {"role": "user", "content": "我叫小明,我今年25岁。"}]response = client.chat.completions.create( model="gpt-3.5-turbo", messages=messages)ai_reply_1 = response.choices[0].message.contentprint(f"AI:{ai_reply_1}")# "你好小明!很高兴认识你。"# 把 AI 的回复加入历史messages.append({"role": "assistant", "content": ai_reply_1})# 第2轮对话messages.append({"role": "user", "content": "我叫什么名字?"})response = client.chat.completions.create( model="gpt-3.5-turbo", messages=messages # 传完整历史!)ai_reply_2 = response.choices[0].message.contentprint(f"AI:{ai_reply_2}")# "你叫小明。"(因为历史里有这个信息)# 把 AI 的回复加入历史messages.append({"role": "assistant", "content": ai_reply_2})# 第3轮对话messages.append({"role": "user", "content": "我几岁?"})response = client.chat.completions.create( model="gpt-3.5-turbo", messages=messages)print(f"AI:{response.choices[0].message.content}")# "你今年25岁。"
4.6 多轮对话的完整交互版本
from openai import OpenAIclient = OpenAI()def chat_loop(): """交互式聊天机器人""" messages = [ {"role": "system", "content": "你是一个知识渊博且幽默的助手。"} ] print("🤖 AI 助手已就绪(输入 'quit' 退出)") print("-" * 40) while True: # 获取用户输入 user_input = input("\n你:").strip() if user_input.lower() in ("quit", "exit", "q"): print("👋 再见!") break if not user_input: continue # 添加用户消息 messages.append({"role": "user", "content": user_input}) # 调用 API response = client.chat.completions.create( model="gpt-3.5-turbo", messages=messages, temperature=0.7, ) # 提取回复 ai_reply = response.choices[0].message.content print(f"\nAI:{ai_reply}") # 添加 AI 回复到历史 messages.append({"role": "assistant", "content": ai_reply}) # ⚠️ 防止历史太长超出上下文窗口 # 简单策略:只保留最近 20 条消息 + system if len(messages) > 21: messages = [messages[0]] + messages[-20:]chat_loop()
4.7 流式输出(打字机效果)
from openai import OpenAIclient = OpenAI()# 普通调用:等 AI 全部生成完才返回(可能等很久)# 流式调用:AI 每生成几个字就立刻推送给你response = client.chat.completions.create( model="gpt-3.5-turbo", messages=[ {"role": "user", "content": "写一首关于秋天的短诗"} ], stream=True, # ⭐ 开启流式)# response 现在是一个生成器(generator),逐块返回full_reply = ""print("AI:", end="")for chunk in response: # 每个 chunk 包含一小段文本 # chunk.choices[0].delta.content 是当前这一小段 # 第一个 chunk 的 delta 可能包含 role # 最后一个 chunk 的 delta.content 可能是 None if chunk.choices[0].delta.content is not None: text = chunk.choices[0].delta.content print(text, end="", flush=True) # 实时打印,不换行 full_reply += textprint() # 最后换行print(f"\n完整回复:{full_reply}")
4.8 流式输出的详细解释
# 流式返回的 chunk 结构:# chunk# ├── .id# ├── .choices# │ └── [0]# │ ├── .delta → 增量内容(不是完整内容!)# │ │ ├── .role → 只在第一个 chunk 出现# │ │ └── .content → 当前这一小段文字(可能是None)# │ ├── .finish_reason → 只在最后一个 chunk 出现("stop")# │ └── .index# └── .created# 为什么需要 flush=True?# Python 的 print 默认有缓冲区# 如果不 flush,文字会攒够一批才显示# flush=True 强制立即输出到屏幕
4.9 n 参数 —— 一次生成多个回复
from openai import OpenAIclient = OpenAI()# n=3:让模型生成3个不同的回复供你选择response = client.chat.completions.create( model="gpt-3.5-turbo", messages=[{"role": "user", "content": "给咖啡店取个名字"}], n=3, # 生成3个候选 temperature=1.0, # 温度高一些,让3个结果差异更大)# 遍历所有候选回复for i, choice in enumerate(response.choices, 1): print(f"方案{i}:{choice.message.content}")# 输出类似:# 方案1:晨曦咖啡# 方案2:豆语时光# 方案3:半日闲咖啡馆
4.10 stop 参数 —— 自定义停止词
from openai import OpenAIclient = OpenAI()# 当模型生成的文本中包含 stop 中的内容时,立即停止response = client.chat.completions.create( model="gpt-3.5-turbo", messages=[ {"role": "user", "content": "列出5种水果,每行一个"} ], stop=["\n4"], # 遇到第4个就停(只要前3个))print(response.choices[0].message.content)# 只会输出前3种水果# 常见用法:# stop=["\n"] → 只生成一行# stop=["。"] → 遇到句号就停# stop=["END"] → 遇到自定义标记就停
4.11 完整参数列表
response = client.chat.completions.create( # ===== 必填参数 ===== model="gpt-3.5-turbo", # 模型名称 messages=[...], # 消息列表 # ===== 可选参数 ===== temperature=0.7, # 随机性(0~2) top_p=1.0, # 核采样(与temperature二选一调) n=1, # 生成几个候选回复 stream=False, # 是否流式输出 stop=None, # 停止词列表 max_tokens=None, # 最大输出token数 presence_penalty=0.0, # 主题惩罚(-2~2,越大越不愿重复话题) frequency_penalty=0.0, # 频率惩罚(-2~2,越大越不愿重复用词) logit_bias=None, # 调整特定token的概率 user=None, # 用户标识(用于OpenAI监控滥用) response_format=None, # 响应格式(如强制JSON) seed=None, # 随机种子(尽量可复现) tools=None, # 可调用的工具/函数 tool_choice=None, # 工具选择策略)
4.12 强制 JSON 输出
from openai import OpenAIimport jsonclient = OpenAI()# 让 AI 严格输出 JSON 格式response = client.chat.completions.create( model="gpt-3.5-turbo", messages=[ { "role": "system", "content": "你是一个数据提取助手。从用户输入中提取信息,以JSON格式输出。" }, { "role": "user", "content": "张三,男,28岁,住在北京海淀区,电话13800138000" } ], response_format={"type": "json_object"}, # ⭐ 强制JSON输出)result = response.choices[0].message.contentdata = json.loads(result) # 安全解析为字典print(data)# {"name": "张三", "gender": "男", "age": 28, # "address": "北京海淀区", "phone": "13800138000"}
五、图像生成(DALL·E)
5.1 文生图(text-to-image)
from openai import OpenAIclient = OpenAI()# ============ DALL·E 3(推荐) ============response = client.images.generate( model="dall-e-3", prompt="一只橘猫坐在窗台上,窗外是下雨的城市夜景,霓虹灯倒映在雨滴中,吉卜力动画风格", size="1024x1024", # 尺寸:1024x1024, 1792x1024, 1024x1792 quality="hd", # 质量:standard(快)或 hd(更精细) style="vivid", # 风格:vivid(生动)或 natural(自然) n=1, # DALL·E 3 只能为 1)# 获取结果image_url = response.data[0].url # 图片URL(有效期1小时)print(f"图片地址:{image_url}")# ⚠️ DALL·E 3 会自动改写你的 prompt(让它更详细)# 查看实际使用的 prompt:print(f"实际prompt:{response.data[0].revised_prompt}")
5.2 下载生成的图片
import requestsfrom openai import OpenAIclient = OpenAI()response = client.images.generate( model="dall-e-3", prompt="水墨画风格的山水,远山如黛,近水含烟", size="1792x1024", quality="hd",)image_url = response.data[0].url# 方法1:用 requests 下载img_response = requests.get(image_url)with open("my_art.png", "wb") as f: f.write(img_response.content)print("图片已保存为 my_art.png")# 方法2:直接请求 base64(不依赖URL有效期)response = client.images.generate( model="dall-e-3", prompt="一只熊猫在吃竹子", response_format="b64_json", # 返回 base64 编码)import base64img_data = base64.b64decode(response.data[0].b64_json)with open("panda.png", "wb") as f: f.write(img_data)
5.3 图像编辑(DALL·E 2)
from openai import OpenAIclient = OpenAI()# 对已有图片进行局部编辑# 需要:原图 + 遮罩图(mask)# 遮罩图中透明区域(alpha=0)的部分会被 AI 重新生成response = client.images.edit( model="dall-e-2", image=open("photo.png", "rb"), # 原图(必须是 PNG,<=4MB) mask=open("mask.png", "rb"), # 遮罩(同尺寸 PNG) prompt="把天空变成紫色的晚霞", # 描述要修改的内容 n=1, size="1024x1024",)edited_url = response.data[0].urlprint(f"编辑后的图片:{edited_url}")
5.4 图像变体(DALL·E 2)
# 生成一张图片的多个变体response = client.images.create_variation( model="dall-e-2", image=open("original.png", "rb"), n=4, # 生成4个变体 size="1024x1024",)for i, img in enumerate(response.data, 1): print(f"变体{i}:{img.url}")
5.5 写好 prompt 的技巧
# ❌ 差的 prompt:"一只猫"# ✅ 好的 prompt(包含:主体 + 动作 + 环境 + 风格 + 光线 + 构图):"""主体:一只银白色的英短猫动作:慵懒地趴在沙发上环境:温暖的客厅,背景有书架和绿植风格:摄影写实风格,浅景深光线:午后的暖黄色阳光从窗户照进来构图:特写,猫占画面2/3"""# 组合成完整 prompt:prompt = ( "一只银白色的英短猫慵懒地趴在米色沙发上," "背景是温馨的客厅,有木质书架和绿色植物," "午后暖黄色阳光从左侧窗户照入," "摄影写实风格,浅景深,特写构图,8K画质")
六、嵌入(Embeddings)
6.1 什么是嵌入?通俗解释
# 嵌入 = 把文字变成一串数字(向量)# 语义相近的文字 → 向量距离近# 语义不同的文字 → 向量距离远# 比喻:# "国王" → [0.8, 0.2, 0.9, ...] ┐# "女王" → [0.79, 0.21, 0.88, ...] ┘ 距离很近!(语义相似)## "国王" → [0.8, 0.2, 0.9, ...] ┐# "香蕉" → [0.1, 0.9, 0.05, ...] ┘ 距离很远!(语义不同)# 用途:# 1. 语义搜索:找"意思相近"的文档# 2. 文本分类:自动归类文章# 3. 聚类:把相似文本分组# 4. RAG(检索增强生成):给 AI 提供相关知识# 5. 推荐系统:找相似内容
6.2 生成嵌入向量
from openai import OpenAIclient = OpenAI()# ============ 单条文本 ============response = client.embeddings.create( model="text-embedding-3-small", # 或 text-embedding-3-large input="机器学习是人工智能的一个分支")embedding = response.data[0].embeddingprint(f"向量维度:{len(embedding)}") # 1536(small)或 3072(large)print(f"前5个值:{embedding[:5]}") # [0.0023, -0.0091, 0.0156, ...]# ============ 批量文本(更高效) ============texts = [ "Python是一种编程语言", "Java也是一种编程语言", "今天天气真好", "我喜欢写代码", "明天会下雨吗",]response = client.embeddings.create( model="text-embedding-3-small", input=texts # 传入列表)# 获取所有向量embeddings = [item.embedding for item in response.data]print(f"生成了 {len(embeddings)} 个向量")print(f"每个向量维度:{len(embeddings[0])}")
6.3 计算文本相似度
from openai import OpenAIimport numpy as npclient = OpenAI()def get_embedding(text): """获取文本的嵌入向量""" response = client.embeddings.create( model="text-embedding-3-small", input=text ) return np.array(response.data[0].embedding)def cosine_similarity(v1, v2): """计算余弦相似度(0~1,越大越相似)""" return np.dot(v1, v2) / (np.linalg.norm(v1) * np.linalg.norm(v2))# 计算三句话的相似度text_a = "我喜欢编程"text_b = "写代码是我的爱好"text_c = "今天中午吃什么"emb_a = get_embedding(text_a)emb_b = get_embedding(text_b)emb_c = get_embedding(text_c)sim_ab = cosine_similarity(emb_a, emb_b)sim_ac = cosine_similarity(emb_a, emb_c)print(f"'{text_a}' vs '{text_b}':相似度 = {sim_ab:.4f}") # ≈ 0.92(很相似)print(f"'{text_a}' vs '{text_c}':相似度 = {sim_ac:.4f}") # ≈ 0.15(不相似)
6.4 语义搜索实战
from openai import OpenAIimport numpy as npclient = OpenAI()# 知识库documents = [ "Python是一种解释型编程语言,适合数据科学和AI开发", "Java是一种面向对象的编程语言,广泛用于企业级开发", "JavaScript是网页开发的核心语言,运行在浏览器中", "C++是一种高性能编程语言,常用于游戏开发和操作系统", "今天股市大涨,上证指数突破3500点", "Python的pandas库是数据分析的利器",]# 1. 预先把所有文档转成向量print("正在构建知识库向量...")doc_embeddings = []for doc in documents: resp = client.embeddings.create( model="text-embedding-3-small", input=doc ) doc_embeddings.append(np.array(resp.data[0].embedding))# 2. 用户提问query = "哪个语言适合做数据分析?"query_resp = client.embeddings.create( model="text-embedding-3-small", input=query)query_embedding = np.array(query_resp.data[0].embedding)# 3. 计算相似度并排序similarities = []for i, doc_emb in enumerate(doc_embeddings): sim = np.dot(query_embedding, doc_emb) / ( np.linalg.norm(query_embedding) * np.linalg.norm(doc_emb) ) similarities.append((sim, i))similarities.sort(reverse=True) # 按相似度降序# 4. 输出最相关的结果print(f"\n查询:'{query}'")print("最相关的文档:")for sim, idx in similarities[:3]: print(f" [{sim:.4f}] {documents[idx]}")# 输出:# [0.8921] Python是一种解释型编程语言,适合数据科学和AI开发# [0.8456] Python的pandas库是数据分析的利器# [0.6234] Java是一种面向对象的编程语言,广泛用于企业级开发
七、语音转文字(Whisper)
7.1 基本转录
from openai import OpenAIclient = OpenAI()# 打开音频文件(支持:mp3, mp4, mpeg, mpga, m4a, wav, webm)# 文件大小限制:25MBaudio_file = open("meeting_recording.mp3", "rb")# 调用转录接口transcript = client.audio.transcriptions.create( model="whisper-1", file=audio_file, # language="zh", # 指定语言(可选,自动检测也行) # response_format="text", # 输出格式:"json"/"text"/"srt"/"vtt"/"verbose_json")print(transcript.text)# "大家好,今天的会议主要讨论三个议题..."
7.2 带时间戳的转录
from openai import OpenAIclient = OpenAI()audio_file = open("podcast.mp3", "rb")# 使用 verbose_json 格式获取时间戳transcript = client.audio.transcriptions.create( model="whisper-1", file=audio_file, response_format="verbose_json", timestamp_granularities=["segment"], # 段落级时间戳)print(f"语言:{transcript.language}")print(f"总时长:{transcript.duration}秒")print()for segment in transcript.segments: start = segment["start"] end = segment["end"] text = segment["text"] print(f"[{start:.1f}s - {end:.1f}s] {text}")# 输出:# [0.0s - 3.2s] 大家好,欢迎收听本期节目# [3.2s - 7.8s] 今天我们要聊的是人工智能的未来# [7.8s - 12.1s] 首先让我们回顾一下AI的发展历程
7.3 生成字幕文件
from openai import OpenAIclient = OpenAI()audio_file = open("video_audio.mp3", "rb")# 生成 SRT 字幕格式transcript = client.audio.transcriptions.create( model="whisper-1", file=audio_file, response_format="srt",)# 保存为字幕文件with open("subtitle.srt", "w", encoding="utf-8") as f: f.write(transcript.text)print("字幕已保存为 subtitle.srt")# SRT 格式示例:# 1# 00:00:00,000 --> 00:00:03,200# 大家好,欢迎收听本期节目## 2# 00:00:03,200 --> 00:00:07,800# 今天我们要聊的是人工智能的未来
7.4 翻译转录
# 把非英语音频直接翻译成英语文字audio_file = open("chinese_speech.mp3", "rb")translation = client.audio.translations.create( model="whisper-1", file=audio_file,)print(translation.text) # 输出英文翻译
(由于内容较多,本期分成15.1和15.2两部分,请继续查看15.2)