超腾开源标签 - 按标签浏览内容
这篇文章详细讲解了使用PyTorch实现四种GAN模型生成MNIST手写数字的完整过程,从最基础的全连接GAN入手,逐步深入到DCGAN、条件GAN和WGAN-GP。文章分别介绍了每种GAN的原理、网络结构、代码实现和结果分析。全连接GAN能生成基本数字轮廓但细节模糊;DCGAN通过卷积层提升图像清晰度;条件GAN加入标签信息实现可控生成;WGAN-GP采用Wasserstein距离和梯度惩罚,训练最稳定。最后总结了技术演进路线,强调数据预处理、标签平滑、卷积架构和WGAN-GP的实用性。
685
2025-04-24
本文通过PyTorch实现Fashion MNIST图像分类,对比了两层和三层卷积网络(CNN)以及BatchNorm层对模型性能的影响。实验表明,三层CNN整体表现优于两层,最佳准确率达92.45%。BatchNorm在充分训练后能提升准确率,但初期无BatchNorm收敛更快。训练轮数需适度,过多可能导致过拟合。最佳方案为CNN-3Conv加BatchNorm训练25轮。文章提供了完整的数据加载、模型定义、训练测试代码及结果分析,结论可扩展至更复杂的图像分类任务。
443
2024-06-21
本文介绍了使用PyTorch实现猫狗图像分类的两种方法:从头构建CNN网络和采用VGG16迁移学习。CNN模型需要更多训练轮次,在20轮时达到最高准确率79.28%,之后出现过拟合。而VGG16仅用5轮就能达到86.5%的准确率,10轮后稳定在86.98%,明显优于CNN。实验表明,在训练数据有限的情况下,利用预训练模型进行迁移学习可以显著提升训练效率和分类准确率,是更优的选择。
516
2025-02-06
PyTorch拥有庞大活跃的开源生态系统,覆盖从计算机视觉、自然语言处理到强化学习、医学影像等多个AI领域。文章整理了PyTorch Landscape中收录的优秀项目,包括三维视觉(PyTorch3D)、CV(torchvision、Detectron2)、NLP(Transformers、Flair)、强化学习(torchrl)、多模态(NeMo、Diffusers)等模型相关项目,以及编译器(ONNX Runtime)、分布式训练(DeepSpeed)、通用工具(einops)、训练框架(PyTorch Lightning)、超参数优化(Optuna)、隐私安全(Opacus)、图神经网络(PyTorch Geometric)等优化与训练工具。生态丰富多元,用户可根据需求找到合适的开源工具。
516
2025-04-28
本文介绍了如何在离线环境下编译PyTorch官方文档。主要内容包括:首先安装git和Python等必要软件,克隆PyTorch源码,创建Python虚拟环境以避免依赖冲突,然后安装requirements.txt中的Sphinx扩展和torch包。使用make html命令生成HTML文档,输出文件位于build/html目录,可直接通过浏览器离线阅读。文章还总结了四种常见编译问题及解决方案:网络错误导致依赖安装失败、缺少torch模块、numpy版本过高导致bool8属性错误、katex版本不兼容。整体流程清晰,适合需要在无网络环境中查阅PyTorch文档的开发者参考。
599
2025-01-13
本文介绍了PyTorch中常用的深度学习优化器,包括Adadelta、Adafactor、Adagrad、Adam、AdamW、SGD等。文章分析了每种优化器的特点、优缺点和适用场景。核心观点是:快速试验推荐Adam,追求泛化性能首选带动量的SGD,需要更好正则化效果可选用AdamW。对于稀疏特征任务,Adagrad和SparseAdam更合适;大模型训练中Adafactor可节省内存。文章强调,实际应用中大多数任务从Adam或SGD开始尝试即可,理解各优化器原理有助于高效训练模型。
462
2025-03-12
本文系统介绍了PyTorch生态系统中的官方工具包及其用途。核心包torch提供张量计算、自动微分、神经网络模块和优化器等基础功能。torchvision用于图像与视频处理,包含常用数据集和预训练模型;torchaudio专注于音频信号处理;torchtext支持NLP任务的数据集和预处理;torchdata实现可组合的数据加载流水线。此外还介绍了torchmetrics、torchserve、torchrec、torchtune等扩展工具,覆盖模型评估、部署、推荐系统和LLM微调等场景。这些官方包共同构成从数据处理到训练部署的完整闭环,满足不同领域开发需求。
557
2024-06-21
本文介绍了PyTorch torchaudio库内置的多种音频数据集及其应用场景。文章详细列举了语音识别与合成(如LIBRISPEECH、COMMONVOICE、LJSPEECH)、语音命令与理解(如SPEECHCOMMANDS)、说话人与情感识别(如VoxCeleb1、IEMOCAP)、语音分离与增强(如LibriMix、MUSDB_HQ)、发音与语音障碍、音乐信息检索等领域的常用数据集。作者指出,这些数据集覆盖了语音处理的主要方向,从基础任务到高级研究均有涉及,方便研究人员和开发者根据具体需求选择使用。文章还提供了LJSPEECH的加载示例,强调通过torchaudio可轻松下载和调用这些数据集。
456
2025-05-01
torchtext 0.18.0 内置了丰富的数据集,覆盖文本分类、语言建模、机器翻译、序列标注、问答系统和无监督学习等NLP主要任务。文章分类介绍了AG_NEWS、IMDb、SQuAD、WikiText等常用数据集及其用途,并展示了使用Python加载IMDb数据的简单示例。这些数据集接口标准化,用户无需手动下载预处理,极大降低了NLP研究入门门槛并确保实验可复现性。
439
2025-05-01
这篇文章全面介绍了PyTorch中torchvision库内置的数据集,涵盖了图像分类(如MNIST、CIFAR、ImageNet)、检测与分割(如COCO、Cityscapes)、光流、立体匹配、视频分类等多个计算机视觉任务领域。文章通过表格详细列出了各数据集的规模、用途和特点,并提供了简单加载示例。核心观点是,torchvision内置的丰富数据集为研究人员和开发者提供了极大便利,支持从入门实验到工业级应用的快速原型验证和算法对比。
499
2025-05-01
本文介绍了PyTorch中常用的激活函数及其功能,强调激活函数为神经网络引入非线性,使其能学习复杂模式。文章详细说明了ReLU、Sigmoid、Tanh、LeakyReLU、PReLU、ELU、GELU、SiLU、Mish等函数的公式、特点与使用示例,并介绍了概率激活函数如Softmax和其余辅助函数。最后提供了场景选择建议,如隐藏层通用推荐ReLU,分类输出用Sigmoid或Softmax,并建议从ReLU开始尝试,遇到问题再转向LeakyReLU或ELU。
461
2025-03-12
本文系统介绍了PyTorch中torch.nn模块的常用层类型及其功能,包括容器(Sequential等)、线性层、卷积层、池化层、正则化层、Dropout层、循环层(LSTM等)、Transformer层、稀疏层(Embedding)和视觉层,并通过代码示例展示了各层的使用方法。文章强调,理解这些层是构建神经网络的基础,最后通过一个完整的CNN分类网络示例综合演示了多种层的配合使用,并建议查阅官方文档获取更详细的信息。
487
2025-03-12
本文介绍了PyTorch中常用的损失函数,按任务类型分类讲解。回归任务包括MSELoss(均方误差)、L1Loss(平均绝对误差)、SmoothL1Loss和HuberLoss;分类任务涵盖CrossEntropyLoss(交叉熵)、BCEWithLogitsLoss(推荐用于二分类)、NLLLoss及KLDivLoss等;特殊任务如CTCLoss用于序列对齐,TripletMarginLoss用于度量学习。文章还给出了任务与损失函数的匹配建议,并提醒注意输入张量形状、是否内置softmax以及正负样本平衡问题。
475
2025-03-12
本文使用PyTorch实现IMDB电影评论情感分析二分类任务,比较了LSTM、CNN和Transformer三种神经网络模型。介绍了数据加载、构建词表、Dataset类和批处理填充的完整流程。实验结果表明,双向LSTM表现最佳,10个epoch时测试准确率达88.93%;CNN训练速度快且不易过拟合,5个epoch达86.68%准确率;Transformer因数据集规模有限表现中等。使用GloVe预训练词向量可提升LSTM性能至88.76%。文章还提供了模型代码实现、训练流程和优化建议,完整代码可在GPU环境下10-20分钟完成训练。
526
2025-02-09
本文全面介绍了PyTorch张量的核心操作,包括张量的定义(如zeros、ones、rand创建方法)、元素访问(类似NumPy的索引方式)、基本数学运算(加减乘除、矩阵乘法、转置)、与NumPy数组的互转、GPU加速计算(通过.cuda())以及自动求导机制。文章通过代码示例展示了各类操作,并重点解析了动态计算图与梯度计算过程。掌握这些基础知识是使用PyTorch进行深度学习开发的重要前提。
501
2024-06-21
本文使用PyTorch实现了三种手写数字识别模型:线性神经网络(98.08%准确率)、卷积神经网络CNN(99.28%)和Vision Transformer ViT(98.30%)。实验表明,CNN在MNIST数据集上表现最佳,能有效提取图像局部特征;ViT虽可捕捉全局依赖,但受限于小图像尺寸,表现中等;线性网络结构简单,适合快速验证。文章还提供了数据加载、模型训练代码及性能对比,并建议通过增加Dropout、学习率调度或数据增强来优化泛化能力。
629
2024-06-21
本文介绍了如何使用PyTorch从零实现线性回归,包括手动梯度下降和PyTorch内置模块两种方式。文章通过生成带噪声的数据集,训练模型学习y=wx+b中的参数w和b。手动实现部分详细演示了前向传播、计算均方误差损失、反向传播求梯度及参数更新过程;PyTorch模块部分则使用nn.Linear、MSELoss和SGD优化器简化代码。两种方法均经过1000次迭代成功拟合直线,参数接近w=1、b=0。文章强调掌握线性回归是深度学习的基础,PyTorch的自动微分机制能有效简化梯度计算。
475
2025-02-06
本文整理了PyTorch机器学习库的入门资源与实战经验,涵盖官方地址、基础教程、数据集介绍、开发实战及常见问题。基础部分包括Windows系统安装、张量操作、神经网络层、激活函数、损失函数和优化器详解。实战案例涵盖线性回归、手写数字识别、Fashion MNIST分类、猫狗图像识别(对比CNN与VGG16迁移学习)以及IMDB电影评论情感分类(LSTM达88.76%准确率)。此外还提供GPU利用率优化、文档离线编译、生态项目汇总等实用信息,并附有Hugging Face、动手学深度学习等扩展学习资源。
802
2024-06-21
本文是一位程序员对十多年开发历程中接触技术的梳理,提供了一份技术路线图。内容涵盖编程语言、应用开发、开发工具及其他领域。编程语言部分介绍了Java、C#、Go、PHP用于B/S架构,C/C++和Rust用于高性能场景,Python主导AI领域,以及汇编用于底层开发。应用开发涉及前端、移动端、Node.js、Electron、三维、GIS、游戏引擎、区块链、人工智能和网站建设等。开发工具包括MinGW、protobuf、GitHub、DNS和VPN。其他领域提及了谷歌文档、密码学、论文下载和量子计算。文章旨在为同行提供清晰的技术参考,突出各技术的适用场景和核心价值。
967
2024-06-21
本文整理了AI入门相关的实用资源,包括常用网站(如Hugging Face镜像、ModelScope、arXiv等)、主流机器学习框架(如scikit-learn、TensorFlow、PyTorch、PaddlePaddle等),以及机器学习基础概念(激活函数、损失函数、优化器)。文章还介绍了多种神经网络模型(如CNN、RNN、LSTM、Transformer)和丰富的AI应用场景,如下围棋、AI绘画、视频修复、大模型、数字人、智能体、AI编程等,帮助读者快速了解AI全貌,跟上时代潮流。
713
2024-06-21