ARTICLE DETAIL

资讯详情

深耕商务建站与企业官网运营的一线实战洞察。

基于Python与Django的旅游推荐系统开发实践

基于Python与Django的旅游推荐系统开发实践 在旅游行业快速发展的背景下如何帮助用户从海量信息中快速找到符合个人偏好的景点和酒店成为一个具有实际价值的技术课题。基于 Python 和 Django 框架构建一个旅游推荐系统不仅能够综合运用爬虫技术进行数据采集、利用推荐算法进行个性化匹配还能通过数据分析和可视化直观展示结果是检验数据处理和算法应用能力的典型项目。本文将带领读者从零开始构建一个具备景点推荐、酒店推荐、数据分析和可视化功能的完整系统适合有一定 Python 基础希望深入 Web 开发、数据挖掘和算法实践的开发者。整个项目将围绕数据获取、存储、处理、推荐和展示的核心链路展开。读者将学习如何使用爬虫技术从公开渠道获取旅游数据如何利用 Django 框架搭建稳健的后端服务如何实现基于协同过滤或内容过滤的推荐算法以及如何使用 ECharts 等前端库进行数据可视化。最终你将拥有一个可运行、可扩展的推荐系统原型并能在此基础上进行更深入的功能迭代。1. 理解旅游推荐系统的核心组件与技术选型一个完整的旅游推荐系统通常包含数据层、算法层、应用层和展示层。数据层负责原始数据的采集与存储算法层负责从数据中提取特征并生成推荐结果应用层负责处理业务逻辑和用户请求展示层则负责将结果以友好的方式呈现给用户。1.1 为什么选择 Django 作为 Web 框架Django 是一个高层次 Python Web 框架它鼓励快速开发和简洁、实用的设计。对于推荐系统这类需要处理复杂数据关系的项目Django 自带的 ORM对象关系映射能够极大简化数据库操作。其内置的管理后台可以快速搭建起数据管理界面便于在开发阶段查看和修改爬取到的景点、酒店数据。此外Django 的结构清晰MTV 模式有助于保持代码的可维护性这对于可能需要长期迭代的毕业设计项目尤为重要。1.2 爬虫策略与伦理边界爬虫是系统数据来源的关键。目标数据源可能包括旅游平台公开的景点信息、酒店列表、用户评论等。常用的爬虫库如requests用于发送 HTTP 请求BeautifulSoup或lxml用于解析 HTML 页面结构Selenium可用于处理 JavaScript 动态渲染的页面。注意在实际操作中必须严格遵守网站的robots.txt协议控制请求频率避免对目标网站服务器造成压力。本项目所有数据采集行为应仅限于公开、非敏感信息并用于个人学习与研究目的。1.3 推荐算法的常见思路推荐算法是系统的“大脑”。常见的算法可分为协同过滤包括基于用户的协同过滤找到相似兴趣的用户推荐他们喜欢的物品和基于物品的协同过滤找到相似属性的物品推荐给喜欢同类物品的用户。这种方法依赖于用户行为数据如评分、点击。内容过滤根据物品的属性如景点的类型、位置、标签和用户的历史偏好进行匹配。这种方法在冷启动新用户或无行为数据阶段表现更好。 对于毕业设计可以先实现一种基础算法如基于物品的协同过滤或 KNN 近邻算法再尝试融合多种策略。1.4 数据可视化的重要性数据可视化不仅能让推荐结果更直观也能在系统开发阶段帮助开发者理解数据分布和算法效果。使用 ECharts、Chart.js 等前端库可以轻松绘制出景点评分分布图、酒店价格热力图、用户兴趣标签云等从而提升整个系统的完整度和表现力。2. 开发环境准备与项目初始化在开始编码之前需要配置一个隔离、可复现的 Python 开发环境并创建 Django 项目的基本结构。2.1 创建并激活 Python 虚拟环境使用虚拟环境可以避免项目间的依赖冲突。推荐使用 Python 3.8 或更高版本。# 创建项目目录并进入 mkdir travel_recommendation_system cd travel_recommendation_system # 创建虚拟环境Windows 和 macOS/Linux 命令略有不同 # Windows python -m venv venv .\venv\Scripts\activate # macOS/Linux python3 -m venv venv source venv/bin/activate激活虚拟环境后命令行提示符前会出现(venv)标识。2.2 安装项目依赖创建requirements.txt文件列出项目所需的核心库。Django4.2.0 requests2.28.2 beautifulsoup44.11.1 pandas1.5.3 numpy1.24.2 scikit-learn1.2.2 django-echarts1.5.1 # 用于Django整合ECharts然后使用 pip 安装pip install -r requirements.txt2.3 创建 Django 项目和核心应用使用 Django 命令行工具初始化项目和应用。# 创建Django项目注意最后有个点表示在当前目录创建 django-admin startproject travel_project . # 创建核心应用例如命名为recommendation python manage.py startapp recommendation创建完成后项目目录结构应如下所示travel_recommendation_system/ ├── manage.py ├── requirements.txt ├── travel_project/ │ ├── __init__.py │ ├── settings.py │ ├── urls.py │ └── wsgi.py └── recommendation/ ├── __init__.py ├── admin.py ├── apps.py ├── models.py ├── tests.py └── views.py2.4 配置数据库和基础设置Django 默认使用 SQLite 数据库这对于毕业设计原型来说已经足够。需要修改travel_project/settings.py文件将新创建的应用加入INSTALLED_APPS并配置静态文件路径。# travel_project/settings.py INSTALLED_APPS [ django.contrib.admin, django.contrib.auth, django.contrib.contenttypes, django.contrib.sessions, django.contrib.messages, django.contrib.staticfiles, recommendation, # 新增的应用 ] # 配置静态文件CSS, JavaScript, Images STATIC_URL static/ STATICFILES_DIRS [BASE_DIR / static] # 项目根目录下的static文件夹 # 配置媒体文件用户上传的图片等 MEDIA_URL /media/ MEDIA_ROOT BASE_DIR / media完成配置后执行数据库迁移创建初始表结构python manage.py migrate3. 数据模型设计与爬虫实现系统的基石是数据。我们需要设计合理的数据库模型来存储景点、酒店和用户行为数据并编写爬虫程序来填充初始数据。3.1 设计核心数据模型在recommendation/models.py中定义核心模型。一个简化的设计可能包括景点、酒店和用户评分模型。from django.db import models class ScenicSpot(models.Model): 景点模型 name models.CharField(max_length200, verbose_name景点名称) location models.CharField(max_length100, verbose_name所在地) description models.TextField(verbose_name描述) tags models.CharField(max_length200, verbose_name标签, help_text用逗号分隔如自然,山水,历史) average_rating models.FloatField(default0.0, verbose_name平均评分) image_url models.URLField(blankTrue, verbose_name图片链接) class Meta: verbose_name 景点 verbose_name_plural verbose_name def __str__(self): return self.name class Hotel(models.Model): 酒店模型 name models.CharField(max_length200, verbose_name酒店名称) location models.CharField(max_length100, verbose_name所在地) price_range models.CharField(max_length50, verbose_name价格区间) amenities models.CharField(max_length300, verbose_name设施, help_text用逗号分隔如WiFi,停车场,游泳池) average_rating models.FloatField(default0.0, verbose_name平均评分) image_url models.URLField(blankTrue, verbose_name图片链接) class Meta: verbose_name 酒店 verbose_name_plural verbose_name def __str__(self): return self.name class UserRating(models.Model): 用户评分模型用于协同过滤算法 user_id models.IntegerField(verbose_name用户ID) # 简化设计实际项目应关联User模型 scenic_spot models.ForeignKey(ScenicSpot, on_deletemodels.CASCADE, nullTrue, blankTrue) hotel models.ForeignKey(Hotel, on_deletemodels.CASCADE, nullTrue, blankTrue) rating models.FloatField(verbose_name评分1-5分) class Meta: verbose_name 用户评分 verbose_name_plural verbose_name # 确保一个用户对同一个物品只能评分一次 unique_together [[user_id, scenic_spot], [user_id, hotel]]定义模型后生成并执行迁移文件python manage.py makemigrations python manage.py migrate3.2 编写基础爬虫脚本在项目根目录下创建一个scripts文件夹用于存放爬虫脚本。以下是一个使用requests和BeautifulSoup爬取模拟景点数据的示例。# scripts/scenic_spider.py import requests from bs4 import BeautifulSoup import os import django import sys # 设置Django环境 sys.path.append(os.path.dirname(os.path.dirname(os.path.abspath(__file__)))) os.environ.setdefault(DJANGO_SETTINGS_MODULE, travel_project.settings) django.setup() from recommendation.models import ScenicSpot def crawl_scenic_spots(): 一个示例爬虫函数从模拟页面爬取景点数据。 实际应用中需替换为目标网站的URL和解析逻辑。 # 示例URL实际应替换为真实且允许爬取的网站 url https://example-travel-site.com/scenic try: headers { User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 } response requests.get(url, headersheaders, timeout10) response.raise_for_status() # 检查请求是否成功 soup BeautifulSoup(response.text, html.parser) # 假设每个景点信息在一个 classspot-item 的div中 spot_items soup.find_all(div, class_spot-item) for item in spot_items: name item.find(h3).text.strip() if item.find(h3) else 未知景点 location item.find(span, class_location).text.strip() if item.find(span, class_location) else 未知地点 description item.find(p, class_desc).text.strip() if item.find(p, class_desc) else 暂无描述 tags item.get(data-tags, ) # 假设标签存储在data属性中 # 避免重复爬取 if not ScenicSpot.objects.filter(namename, locationlocation).exists(): ScenicSpot.objects.create( namename, locationlocation, descriptiondescription, tagstags, average_rating0.0 # 初始评分 ) print(f成功添加景点: {name}) else: print(f景点已存在: {name}) except requests.RequestException as e: print(f爬取过程中发生错误: {e}) if __name__ __main__: crawl_scenic_spots()运行此脚本前务必确保已激活虚拟环境并正确设置了 Django 环境。python scripts/scenic_spider.py注意由于网络环境和网站结构的不可控性爬虫脚本极易因网站改版而失效。在毕业设计中更稳妥的做法是准备一份静态的、结构化的 JSON 或 CSV 文件作为初始数据源通过 Django 的管理命令或自定义脚本将数据导入数据库。这能确保项目演示时数据源的稳定性。4. 推荐算法核心实现有了数据之后核心任务是实现推荐逻辑。这里以基于物品的协同过滤Item-Based Collaborative Filtering为例介绍如何在 Django 中集成推荐算法。4.1 构建用户-物品评分矩阵协同过滤算法的基础是一个用户对物品的评分矩阵。我们需要从UserRating模型中提取数据构建这个矩阵。在recommendation应用下创建一个新文件recommendation/algorithms.py。# recommendation/algorithms.py import numpy as np import pandas as pd from sklearn.metrics.pairwise import cosine_similarity from django.db.models import Count from .models import UserRating, ScenicSpot class ItemCFRecommender: 基于物品的协同过滤推荐器 def __init__(self): self.similarity_matrix None self.item_ids None def fit(self, min_ratings5): 训练模型计算物品间的相似度矩阵。 min_ratings: 物品最少被评分次数用于过滤冷门物品。 # 获取评分数据 ratings UserRating.objects.all().values(user_id, scenic_spot_id, rating) if not ratings: print(警告暂无评分数据无法计算相似度。) return df pd.DataFrame(list(ratings)) # 过滤掉被评分次数过少的物品 item_rating_counts df[scenic_spot_id].value_counts() valid_items item_rating_counts[item_rating_counts min_ratings].index df df[df[scenic_spot_id].isin(valid_items)] if df.empty: print(警告经过过滤后无有效数据。) return # 构建用户-物品评分矩阵 rating_matrix df.pivot_table(indexuser_id, columnsscenic_spot_id, valuesrating, fill_value0) # 计算物品间的余弦相似度 self.similarity_matrix cosine_similarity(rating_matrix.T) self.item_ids rating_matrix.columns.tolist() print(f相似度矩阵计算完成共 {len(self.item_ids)} 个物品。) def recommend_items(self, target_item_id, top_n5): 为指定物品推荐相似的物品。 target_item_id: 目标物品的ID。 top_n: 返回推荐物品的数量。 if self.similarity_matrix is None: print(请先调用 fit() 方法训练模型。) return [] try: # 找到目标物品在矩阵中的索引 item_index self.item_ids.index(target_item_id) except ValueError: print(f物品ID {target_item_id} 不在训练集中。) return [] # 获取目标物品与其他所有物品的相似度 item_similarities self.similarity_matrix[item_index] # 按相似度降序排序并排除自身相似度为1 similar_indices np.argsort(item_similarities)[::-1][1:top_n1] recommended_item_ids [self.item_ids[i] for i in similar_indices] return recommended_item_ids # 全局推荐器实例可在view中调用 item_cf_recommender ItemCFRecommender()4.2 在 Django View 中调用推荐算法接下来在recommendation/views.py中创建视图函数用于接收用户请求并返回推荐结果。# recommendation/views.py from django.shortcuts import render, get_object_or_404 from django.http import JsonResponse from .models import ScenicSpot, Hotel from .algorithms import item_cf_recommender def scenic_spot_detail(request, spot_id): 景点详情页并展示相似推荐 scenic_spot get_object_or_404(ScenicSpot, pkspot_id) # 获取相似景点推荐 recommended_spot_ids item_cf_recommender.recommend_items(spot_id, top_n3) recommended_spots ScenicSpot.objects.filter(id__inrecommended_spot_ids) context { scenic_spot: scenic_spot, recommended_spots: recommended_spots, } return render(request, recommendation/scenic_spot_detail.html, context) def get_recommendations_api(request): 为AJAX请求提供推荐结果的API接口 if request.method GET: item_type request.GET.get(type, scenic) # scenic 或 hotel item_id request.GET.get(item_id) if not item_id: return JsonResponse({error: Missing item_id}, status400) try: item_id int(item_id) except ValueError: return JsonResponse({error: Invalid item_id}, status400) if item_type scenic: recommended_ids item_cf_recommender.recommend_items(item_id) items list(ScenicSpot.objects.filter(id__inrecommended_ids).values(id, name, image_url)) return JsonResponse({recommendations: items}) # 可以扩展酒店推荐逻辑 else: return JsonResponse({error: Unsupported item type}, status400) return JsonResponse({error: Method not allowed}, status405)4.3 配置 URL 路由在recommendation应用下创建urls.py文件并配置视图的路由。# recommendation/urls.py from django.urls import path from . import views app_name recommendation urlpatterns [ path(scenic/int:spot_id/, views.scenic_spot_detail, namescenic_spot_detail), path(api/recommendations/, views.get_recommendations_api, nameget_recommendations_api), ]然后将应用的路由包含到项目的主路由中。# travel_project/urls.py from django.contrib import admin from django.urls import path, include urlpatterns [ path(admin/, admin.site.urls), path(, include(recommendation.urls)), # 包含推荐应用的URL ]5. 数据可视化与前端展示一个优秀的系统不仅要有强大的后端还要有直观的前端界面。我们将使用 Django 模板和 ECharts 来展示数据和推荐结果。5.1 创建基础模板和景点详情页首先在recommendation应用下创建templates/recommendation目录并创建基础模板base.html。!-- recommendation/templates/recommendation/base.html -- !DOCTYPE html html langzh-CN head meta charsetUTF-8 meta nameviewport contentwidthdevice-width, initial-scale1.0 title{% block title %}旅游推荐系统{% endblock %}/title link hrefhttps://cdn.jsdelivr.net/npm/bootstrap5.1.3/dist/css/bootstrap.min.css relstylesheet {% block extra_css %}{% endblock %} /head body nav classnavbar navbar-expand-lg navbar-dark bg-dark div classcontainer a classnavbar-brand href/旅游推荐系统/a /div /nav div classcontainer mt-4 {% block content %} {% endblock %} /div script srchttps://cdn.jsdelivr.net/npm/bootstrap5.1.3/dist/js/bootstrap.bundle.min.js/script !-- 引入ECharts -- script srchttps://cdn.jsdelivr.net/npm/echarts5.4.2/dist/echarts.min.js/script {% block extra_js %}{% endblock %} /body /html然后创建景点详情页模板scenic_spot_detail.html。!-- recommendation/templates/recommendation/scenic_spot_detail.html -- {% extends recommendation/base.html %} {% block title %}{{ scenic_spot.name }} - 旅游推荐系统{% endblock %} {% block content %} div classrow div classcol-md-8 h1{{ scenic_spot.name }}/h1 pstrong位置/strong{{ scenic_spot.location }}/p pstrong描述/strong{{ scenic_spot.description }}/p pstrong标签/strong {% for tag in scenic_spot.tags.split %} span classbadge bg-secondary{{ tag }}/span {% endfor %} /p pstrong平均评分/strong{{ scenic_spot.average_rating }}/p /div div classcol-md-4 {% if scenic_spot.image_url %} img src{{ scenic_spot.image_url }} alt{{ scenic_spot.name }} classimg-fluid {% endif %} /div /div hr !-- 相似推荐区域 -- h3您可能也喜欢/h3 div classrow idrecommendations-container {% for spot in recommended_spots %} div classcol-md-4 mb-3 div classcard {% if spot.image_url %} img src{{ spot.image_url }} classcard-img-top alt{{ spot.name }} {% endif %} div classcard-body h5 classcard-title{{ spot.name }}/h5 p classcard-text{{ spot.location }}/p a href{% url recommendation:scenic_spot_detail spot.id %} classbtn btn-primary查看详情/a /div /div /div {% empty %} p暂无推荐数据或该景点太独特了/p {% endfor %} /div !-- 评分分布图 -- div idrating-chart stylewidth: 100%; height: 400px; margin-top: 20px;/div {% endblock %} {% block extra_js %} script // 使用ECharts绘制评分分布图示例 var chartDom document.getElementById(rating-chart); var myChart echarts.init(chartDom); var option; // 这里应该是从后端API获取的真实数据此处为示例 option { title: { text: 景点评分分布 }, tooltip: {}, xAxis: { data: [1星, 2星, 3星, 4星, 5星] }, yAxis: {}, series: [{ name: 数量, type: bar, data: [5, 20, 36, 10, 10] // 模拟数据 }] }; option myChart.setOption(option); /script {% endblock %}5.2 实现数据看板视图为了整体展示系统数据可以创建一个数据看板视图集中展示景点统计、热门标签等可视化图表。在views.py中添加# recommendation/views.py from django.db.models import Count from collections import Counter import json def dashboard(request): 数据看板 # 统计景点数量按地区分布 location_stats ScenicSpot.objects.values(location).annotate(countCount(id)).order_by(-count) location_names [item[location] for item in location_stats] location_counts [item[count] for item in location_stats] # 统计所有标签 all_tags [] for spot in ScenicSpot.objects.all(): if spot.tags: all_tags.extend([tag.strip() for tag in spot.tags.split(,)]) tag_counter Counter(all_tags) top_tags tag_counter.most_common(10) # 取前10个最常见标签 tag_names [tag[0] for tag in top_tags] tag_counts [tag[1] for tag in top_tags] context { location_names_json: json.dumps(location_names), location_counts_json: json.dumps(location_counts), tag_names_json: json.dumps(tag_names), tag_counts_json: json.dumps(tag_counts), } return render(request, recommendation/dashboard.html, context)对应的模板dashboard.html可以充分利用 ECharts 绘制柱状图和饼图。6. 系统运行、测试与常见问题排查完成核心开发后需要确保系统能正常运行并了解如何排查可能出现的问题。6.1 启动开发服务器在项目根目录下执行以下命令启动 Django 开发服务器python manage.py runserver访问http://127.0.0.1:8000/admin/可以进入管理后台需先创建超级用户python manage.py createsuperuser访问http://127.0.0.1:8000可以查看前端页面。6.2 初始化数据和训练模型在系统首次运行时需要数据来支撑推荐算法。可以通过 Django Shell 批量创建一些模拟的评分数据。python manage.py shell在打开的 Shell 中执行from recommendation.models import ScenicSpot, UserRating import random # 获取所有景点 spots list(ScenicSpot.objects.all()) user_ids list(range(1, 101)) # 模拟100个用户 # 为每个用户随机对部分景点评分 for user_id in user_ids: rated_spots random.sample(spots, krandom.randint(5, 20)) # 每个用户评5-20个景点 for spot in rated_spots: rating random.uniform(1.0, 5.0) # 随机生成1-5分的评分 UserRating.objects.get_or_create(user_iduser_id, scenic_spotspot, defaults{rating: round(rating, 1)}) print(模拟评分数据生成完毕。)退出 Shell 后即可调用之前编写的item_cf_recommender.fit()方法来训练推荐模型。可以在某个视图如系统首页的视图中调用它确保模型在服务器启动后即被训练。6.3 常见问题与解决方案在开发过程中可能会遇到以下典型问题问题现象可能原因检查与解决方式访问页面出现TemplateDoesNotExist错误模板路径错误或未配置检查templates目录结构是否正确并在settings.py的TEMPLATES的DIRS中添加[BASE_DIR / templates]推荐结果始终为空或报错1. 评分数据不足2. 目标物品ID不在训练集中3. 算法模型未训练1. 检查UserRating表中是否有足够数据2. 确认传入的item_id确实存在3. 确保在调用recommend_items前已成功调用fit()方法爬虫脚本无法导入Django模型Django环境未正确设置确保在脚本开头正确配置了DJANGO_SETTINGS_MODULE和sys.path静态文件CSS/JS无法加载静态文件配置错误或未收集开发阶段确认STATICFILES_DIRS设置正确。生产部署需运行python manage.py collectstatic管理后台无法登录或样式错乱数据库表未创建或静态文件问题执行python manage.py migrate创建表并检查静态文件路径6.4 性能与优化建议推荐算法预热对于小型系统可以在服务启动时一次性计算好物品相似度矩阵并缓存避免每次请求都重复计算。数据库查询优化使用select_related或prefetch_related来减少ORM查询次数特别是在列表页和详情页。引入缓存对于不经常变化的推荐结果或景点数据可以使用 Django 的缓存框架如 Redis进行缓存显著提升响应速度。异步任务数据爬取和模型训练等耗时操作应使用 Celery 等工具转为异步任务避免阻塞 Web 请求。7. 项目扩展方向与总结本系统实现了一个旅游推荐系统的基础框架但仍有很大的扩展空间。7.1 功能扩展用户系统集成 Django 自带的用户认证系统实现用户注册、登录、个人收藏和历史记录功能。混合推荐结合协同过滤和基于内容的推荐例如当协同过滤数据不足时用内容相似度进行补充。实时推荐引入流处理技术根据用户最近的点击行为实时调整推荐结果。酒店推荐完善酒店的模型和推荐算法实现景点与酒店的联动推荐如“玩了这个景点附近推荐这些酒店”。情感分析对用户评论进行情感分析将情感分数作为推荐权重之一。7.2 工程化改进RESTful API使用 Django REST Framework 将后端彻底 API 化方便与移动端应用对接。容器化部署使用 Docker 和 Docker Compose 将项目容器化简化部署流程。日志与监控增加详细的日志记录并集成 Sentry 等工具进行错误监控。这个项目完整地串联了 Python Web 开发、数据爬取、算法应用和可视化展示等多个技术环节是检验综合能力的优秀毕业设计选题。通过动手实现你不仅能加深对 Django 框架和推荐算法的理解更能掌握从需求分析到产品上线的全流程开发思维。建议在完成基础功能后选择一两个扩展方向进行深入研究让你的项目更具亮点。
返回列表
PREV
查看更多资讯
NEXT
返回资讯列表