超腾开源博客 - 第5页 | AI技术、开发实战与软件资源分享
这篇文章全面介绍了PyTorch中torchvision库内置的数据集,涵盖了图像分类(如MNIST、CIFAR、ImageNet)、检测与分割(如COCO、Cityscapes)、光流、立体匹配、视频分类等多个计算机视觉任务领域。文章通过表格详细列出了各数据集的规模、用途和特点,并提供了简单加载示例。核心观点是,torchvision内置的丰富数据集为研究人员和开发者提供了极大便利,支持从入门实验到工业级应用的快速原型验证和算法对比。
489
0
发布于2026年5月26日
本文介绍了PyTorch中常用的激活函数及其功能,强调激活函数为神经网络引入非线性,使其能学习复杂模式。文章详细说明了ReLU、Sigmoid、Tanh、LeakyReLU、PReLU、ELU、GELU、SiLU、Mish等函数的公式、特点与使用示例,并介绍了概率激活函数如Softmax和其余辅助函数。最后提供了场景选择建议,如隐藏层通用推荐ReLU,分类输出用Sigmoid或Softmax,并建议从ReLU开始尝试,遇到问题再转向LeakyReLU或ELU。
451
0
发布于2026年5月26日
本文系统介绍了PyTorch中torch.nn模块的常用层类型及其功能,包括容器(Sequential等)、线性层、卷积层、池化层、正则化层、Dropout层、循环层(LSTM等)、Transformer层、稀疏层(Embedding)和视觉层,并通过代码示例展示了各层的使用方法。文章强调,理解这些层是构建神经网络的基础,最后通过一个完整的CNN分类网络示例综合演示了多种层的配合使用,并建议查阅官方文档获取更详细的信息。
474
0
发布于2026年5月26日
本文介绍了PyTorch中常用的损失函数,按任务类型分类讲解。回归任务包括MSELoss(均方误差)、L1Loss(平均绝对误差)、SmoothL1Loss和HuberLoss;分类任务涵盖CrossEntropyLoss(交叉熵)、BCEWithLogitsLoss(推荐用于二分类)、NLLLoss及KLDivLoss等;特殊任务如CTCLoss用于序列对齐,TripletMarginLoss用于度量学习。文章还给出了任务与损失函数的匹配建议,并提醒注意输入张量形状、是否内置softmax以及正负样本平衡问题。
463
0
发布于2026年5月26日
本文使用PyTorch实现IMDB电影评论情感分析二分类任务,比较了LSTM、CNN和Transformer三种神经网络模型。介绍了数据加载、构建词表、Dataset类和批处理填充的完整流程。实验结果表明,双向LSTM表现最佳,10个epoch时测试准确率达88.93%;CNN训练速度快且不易过拟合,5个epoch达86.68%准确率;Transformer因数据集规模有限表现中等。使用GloVe预训练词向量可提升LSTM性能至88.76%。文章还提供了模型代码实现、训练流程和优化建议,完整代码可在GPU环境下10-20分钟完成训练。
515
0
发布于2026年5月26日
本文全面介绍了PyTorch张量的核心操作,包括张量的定义(如zeros、ones、rand创建方法)、元素访问(类似NumPy的索引方式)、基本数学运算(加减乘除、矩阵乘法、转置)、与NumPy数组的互转、GPU加速计算(通过.cuda())以及自动求导机制。文章通过代码示例展示了各类操作,并重点解析了动态计算图与梯度计算过程。掌握这些基础知识是使用PyTorch进行深度学习开发的重要前提。
491
0
发布于2026年5月26日
本文使用PyTorch实现了三种手写数字识别模型:线性神经网络(98.08%准确率)、卷积神经网络CNN(99.28%)和Vision Transformer ViT(98.30%)。实验表明,CNN在MNIST数据集上表现最佳,能有效提取图像局部特征;ViT虽可捕捉全局依赖,但受限于小图像尺寸,表现中等;线性网络结构简单,适合快速验证。文章还提供了数据加载、模型训练代码及性能对比,并建议通过增加Dropout、学习率调度或数据增强来优化泛化能力。
618
0
发布于2026年5月26日
本文介绍了如何使用PyTorch从零实现线性回归,包括手动梯度下降和PyTorch内置模块两种方式。文章通过生成带噪声的数据集,训练模型学习y=wx+b中的参数w和b。手动实现部分详细演示了前向传播、计算均方误差损失、反向传播求梯度及参数更新过程;PyTorch模块部分则使用nn.Linear、MSELoss和SGD优化器简化代码。两种方法均经过1000次迭代成功拟合直线,参数接近w=1、b=0。文章强调掌握线性回归是深度学习的基础,PyTorch的自动微分机制能有效简化梯度计算。
466
0
发布于2026年5月26日
本文整理了PyTorch机器学习库的入门资源与实战经验,涵盖官方地址、基础教程、数据集介绍、开发实战及常见问题。基础部分包括Windows系统安装、张量操作、神经网络层、激活函数、损失函数和优化器详解。实战案例涵盖线性回归、手写数字识别、Fashion MNIST分类、猫狗图像识别(对比CNN与VGG16迁移学习)以及IMDB电影评论情感分类(LSTM达88.76%准确率)。此外还提供GPU利用率优化、文档离线编译、生态项目汇总等实用信息,并附有Hugging Face、动手学深度学习等扩展学习资源。
793
3
发布于2026年5月23日
本文是一位程序员对十多年开发历程中接触技术的梳理,提供了一份技术路线图。内容涵盖编程语言、应用开发、开发工具及其他领域。编程语言部分介绍了Java、C#、Go、PHP用于B/S架构,C/C++和Rust用于高性能场景,Python主导AI领域,以及汇编用于底层开发。应用开发涉及前端、移动端、Node.js、Electron、三维、GIS、游戏引擎、区块链、人工智能和网站建设等。开发工具包括MinGW、protobuf、GitHub、DNS和VPN。其他领域提及了谷歌文档、密码学、论文下载和量子计算。文章旨在为同行提供清晰的技术参考,突出各技术的适用场景和核心价值。
953
0
发布于2026年5月23日