- 当 requests 拿不到数据、Selenium 跑不动并发时,这套架构救了我一个让我失眠的夜晚去年秋天接了一个电商价格监控的项目,甲方要求实时抓取日本雅虎拍卖的商品数据——当前出价、剩余时间、竞拍人数,延迟不能超过 5 秒。一开始我想得挺简单:requests + BeautifulSoup,半小时写完,跑起来一看——页面一片空白。原因不复杂:雅虎拍卖的商品页是典型的 SPA(单页应用)... 当 requests 拿不到数据、Selenium 跑不动并发时,这套架构救了我一个让我失眠的夜晚去年秋天接了一个电商价格监控的项目,甲方要求实时抓取日本雅虎拍卖的商品数据——当前出价、剩余时间、竞拍人数,延迟不能超过 5 秒。一开始我想得挺简单:requests + BeautifulSoup,半小时写完,跑起来一看——页面一片空白。原因不复杂:雅虎拍卖的商品页是典型的 SPA(单页应用)...
- 上一篇文章介绍了如何从TXT文件读取文本信息,可是日常办公很少使用纯文本的TXT格式,而采用专业的PDF格式或者WORD格式,有时还需要通过网页抓取知识。接下来就介绍如何从PDF、WORD、HTML等文件中读取文本内容。一、从PDF文件读取文本PDF是一种常用的文档格式,常用于只读的通知文件,或者电子版书籍。Python提供了多种三方库用来解析PDF文件,其中pdfplumber较常用。使... 上一篇文章介绍了如何从TXT文件读取文本信息,可是日常办公很少使用纯文本的TXT格式,而采用专业的PDF格式或者WORD格式,有时还需要通过网页抓取知识。接下来就介绍如何从PDF、WORD、HTML等文件中读取文本内容。一、从PDF文件读取文本PDF是一种常用的文档格式,常用于只读的通知文件,或者电子版书籍。Python提供了多种三方库用来解析PDF文件,其中pdfplumber较常用。使...
- 本周 Python 生态迎来多项重大更新:Python 3.15 Beta 3 发布,引入延迟导入、冻结字典等多项 PEP;Django 6.1 Beta 1 开放社区测试;Astral(Ruff/uv)团队加入 OpenAI。此外 ... 本周 Python 生态迎来多项重大更新:Python 3.15 Beta 3 发布,引入延迟导入、冻结字典等多项 PEP;Django 6.1 Beta 1 开放社区测试;Astral(Ruff/uv)团队加入 OpenAI。此外 ...
- 智能天气助手实战:基于 openJiuwen Agent Core 的 ReAct Agent 开发全流程 一、项目背景与价值在数字化时代,天气信息已成为人们日常决策的重要依据。传统的天气应用多停留在数据展示层面,而智能天气助手则通过 AI 技术实现了从数据提供到智能服务的跃迁。本项目基于 openJiuwen Agent Core 框架,构建了一个能够理解自然语言、提供个性化建议、具备智... 智能天气助手实战:基于 openJiuwen Agent Core 的 ReAct Agent 开发全流程 一、项目背景与价值在数字化时代,天气信息已成为人们日常决策的重要依据。传统的天气应用多停留在数据展示层面,而智能天气助手则通过 AI 技术实现了从数据提供到智能服务的跃迁。本项目基于 openJiuwen Agent Core 框架,构建了一个能够理解自然语言、提供个性化建议、具备智...
- 一、最简分层逻辑(核心 4 层)路由层 routers:接收请求、参数校验、返回响应,不写业务逻辑业务层 services:核心业务逻辑,调用数据库、第三方接口数据层 db/models/crud:模型定义、数据库增删改查公共层 core/schemas/utils:配置、Pydantic 模型、工具函数、依赖二、完整目录结构(推荐)plaintextfastapi_project/├── ... 一、最简分层逻辑(核心 4 层)路由层 routers:接收请求、参数校验、返回响应,不写业务逻辑业务层 services:核心业务逻辑,调用数据库、第三方接口数据层 db/models/crud:模型定义、数据库增删改查公共层 core/schemas/utils:配置、Pydantic 模型、工具函数、依赖二、完整目录结构(推荐)plaintextfastapi_project/├── ...
- 全文手把手,不装逼,不跳过任何步骤,跟着做一定能跑通写在前面先说个真实感受——我刚开始接触自动化测试那会儿,被Selenium的环境配置折磨得够呛。ChromeDriver版本对不上、路径配不对、动不动就报错,光是“跑起来”这一步就卡了我一整天。后来团队里一位老哥推荐了Playwright,说“你试试这个,不用配驱动”。我当时将信将疑,结果十分钟真跑通了第一个脚本。所以这篇教程就是写给当年的... 全文手把手,不装逼,不跳过任何步骤,跟着做一定能跑通写在前面先说个真实感受——我刚开始接触自动化测试那会儿,被Selenium的环境配置折磨得够呛。ChromeDriver版本对不上、路径配不对、动不动就报错,光是“跑起来”这一步就卡了我一整天。后来团队里一位老哥推荐了Playwright,说“你试试这个,不用配驱动”。我当时将信将疑,结果十分钟真跑通了第一个脚本。所以这篇教程就是写给当年的...
- 你盯着开发岗卷生卷死的时候,有人已经在测试岗悄悄上岸了。7月刚到,大厂提前批已经陆续开枪。腾讯技术研发提前批7月下旬启动,字节跳动7月初开放,阿里、美团、京东7月中旬陆续跟进。到8月底,大部分提前批窗口就会关闭——满打满算,也就30天左右。这30天里,有个岗位经常被大家忽视,但实际上是大厂提前批真正的“捡漏”机会:软件测试开发。一、为什么说测试岗是提前批的“隐藏福利”?很多同学对测试岗的印象... 你盯着开发岗卷生卷死的时候,有人已经在测试岗悄悄上岸了。7月刚到,大厂提前批已经陆续开枪。腾讯技术研发提前批7月下旬启动,字节跳动7月初开放,阿里、美团、京东7月中旬陆续跟进。到8月底,大部分提前批窗口就会关闭——满打满算,也就30天左右。这30天里,有个岗位经常被大家忽视,但实际上是大厂提前批真正的“捡漏”机会:软件测试开发。一、为什么说测试岗是提前批的“隐藏福利”?很多同学对测试岗的印象...
- 前面的文章在构建RAG并检索时,既使用了国外大模型,也使用了国内大模型;既运用了内存向量检索库FAISS,也运用了磁盘向量数据库Chroma。但知识库的原始来源却是knowledge数组,这与现实场合有所出入,因为实际资料都保存在TXT、PDF、WORD等格式的文档中,甚至来自互联网上的HTML网页,于是RAG的前置条件就成了如何从这些文档中提取文本信息。一、读取TXT文件中的文本TXT文件... 前面的文章在构建RAG并检索时,既使用了国外大模型,也使用了国内大模型;既运用了内存向量检索库FAISS,也运用了磁盘向量数据库Chroma。但知识库的原始来源却是knowledge数组,这与现实场合有所出入,因为实际资料都保存在TXT、PDF、WORD等格式的文档中,甚至来自互联网上的HTML网页,于是RAG的前置条件就成了如何从这些文档中提取文本信息。一、读取TXT文件中的文本TXT文件...
- 随着 AI 应用和实时分析场景深入,进入数据平台的不再只是结构化业务表。日志、JSON、文本内容、行为事件、模型推理结果等半结构化和非结构化数据,正在成为实时分析的常见对象。与此同时,分析链路中要完成的工作也在变化:它不再只是 COUNT、SUM、GROUP BY,还包括规则判断、字段解析、特征加工、标签抽取、模型打分等更复杂的业务逻辑。这些逻辑往往更适合用 Python 实现。但如果把数据... 随着 AI 应用和实时分析场景深入,进入数据平台的不再只是结构化业务表。日志、JSON、文本内容、行为事件、模型推理结果等半结构化和非结构化数据,正在成为实时分析的常见对象。与此同时,分析链路中要完成的工作也在变化:它不再只是 COUNT、SUM、GROUP BY,还包括规则判断、字段解析、特征加工、标签抽取、模型打分等更复杂的业务逻辑。这些逻辑往往更适合用 Python 实现。但如果把数据...
- 检索增强生成(RAG)是解决 LLM 幻觉问题的关键技术。本文深入实践向量检索与上下文注入。 检索增强生成(RAG)是解决 LLM 幻觉问题的关键技术。本文深入实践向量检索与上下文注入。
- 前面两篇文章在演示RAG功能时,做向量化的文本嵌入模型都用国外的all-MiniLM-L6-v2,该模型主要适用英文,对于中文总体也能用,但在细节上处理欠佳。本文就来介绍如何使用国产离线的文本嵌入模型替换国外模型,以及如何体现国产模型的比较优势。一、all-MiniLM-L6-v2的缺点虽然all-MiniLM-L6-v2的优点很多,比如下列几点:1、体积极小:几十 MB,随便本地离线下载2... 前面两篇文章在演示RAG功能时,做向量化的文本嵌入模型都用国外的all-MiniLM-L6-v2,该模型主要适用英文,对于中文总体也能用,但在细节上处理欠佳。本文就来介绍如何使用国产离线的文本嵌入模型替换国外模型,以及如何体现国产模型的比较优势。一、all-MiniLM-L6-v2的缺点虽然all-MiniLM-L6-v2的优点很多,比如下列几点:1、体积极小:几十 MB,随便本地离线下载2...
- 本期涵盖 Pluggy 插件系统实战、Python 接口实现方式(ABC 与 Protocols)、Scrapy 扩展开发、2026 年任务队列库选型对比、Python 3.14 垃圾回收改进与回退、PyCon US 2026 安全专... 本期涵盖 Pluggy 插件系统实战、Python 接口实现方式(ABC 与 Protocols)、Scrapy 扩展开发、2026 年任务队列库选型对比、Python 3.14 垃圾回收改进与回退、PyCon US 2026 安全专...
- RAG 技术全景解析:原理、架构与实战代码实现在大型语言模型(LLM)爆发式增长的今天,我们面临着两个核心挑战:幻觉问题(Hallucination)和知识滞后性。LLM 基于训练数据生成内容,一旦训练数据过时或涉及私有领域知识,模型往往无法给出准确答案,甚至产生看似合理实则错误的“幻觉”。检索增强生成(Retrieval-Augmented Generation, RAG)技术应运而生。... RAG 技术全景解析:原理、架构与实战代码实现在大型语言模型(LLM)爆发式增长的今天,我们面临着两个核心挑战:幻觉问题(Hallucination)和知识滞后性。LLM 基于训练数据生成内容,一旦训练数据过时或涉及私有领域知识,模型往往无法给出准确答案,甚至产生看似合理实则错误的“幻觉”。检索增强生成(Retrieval-Augmented Generation, RAG)技术应运而生。...
- 构建智能问答系统:深入解析与实战 RAG(检索增强生成)技术在大型语言模型(LLM)迅猛发展的今天,企业和个人用户对于智能问答系统的需求日益增长。然而,传统的基于纯 LLM 的问答系统面临着两个核心痛点:知识滞后性和幻觉问题。LLM 的训练数据存在截止时间,无法实时获取最新信息;同时,它们在缺乏具体事实依据时,往往会“自信地编造”答案。为了解决这些问题,检索增强生成(Retrieval-A... 构建智能问答系统:深入解析与实战 RAG(检索增强生成)技术在大型语言模型(LLM)迅猛发展的今天,企业和个人用户对于智能问答系统的需求日益增长。然而,传统的基于纯 LLM 的问答系统面临着两个核心痛点:知识滞后性和幻觉问题。LLM 的训练数据存在截止时间,无法实时获取最新信息;同时,它们在缺乏具体事实依据时,往往会“自信地编造”答案。为了解决这些问题,检索增强生成(Retrieval-A...
- 重塑大模型的知识边界:深入解析 RAG 技术与实战落地在生成式人工智能(Generative AI)爆发式增长的今天,大型语言模型(LLM)如 GPT-4、Llama 3 等展现出了惊人的推理和创作能力。然而,随着应用的深入,一个核心痛点日益凸显:知识时效性滞后与领域知识匮乏。依靠海量数据预训练的模型,其知识截止于训练数据的停止时间,且无法获取企业内部的私有数据(如文档、数据库记录)。此外... 重塑大模型的知识边界:深入解析 RAG 技术与实战落地在生成式人工智能(Generative AI)爆发式增长的今天,大型语言模型(LLM)如 GPT-4、Llama 3 等展现出了惊人的推理和创作能力。然而,随着应用的深入,一个核心痛点日益凸显:知识时效性滞后与领域知识匮乏。依靠海量数据预训练的模型,其知识截止于训练数据的停止时间,且无法获取企业内部的私有数据(如文档、数据库记录)。此外...
上滑加载中
推荐直播
-
华为云码道Skill实战与极速交付,智能开发全链路实战2026/07/22 周三 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;姜浩-华为云HCDG核心组成员
直播深度解读华为云码道6月产品新特性,从Skill市场安装专家技能,带你零距离体验从需求,开发,审查,重构全链路闭环的开发过程。从零构建并交付一个完整项目,让您体验从代码提交到服务上线的“极速”之旅。
回顾中 -
聚开发者之力,创具身新未来2026/07/23 周四 15:00-17:00
张豪杰/程文/王军/刘新春/黄钦开 /张晓天
本次华为云具身智能开发平台CloudRobo培训面向具身智能开发者,带您全流程体验机器人本体R2C小时级接入、环境重建与轨迹生成仿真数据生产、PB级数据管理、数据评测、模型训推、强化学习和Benchmark一键评测等功能,并体验业界主流具身模型应用。
即将直播
热门标签