输入层
- 节点数:通常为7x7=49个节点,适合处理小尺寸或需要特定输入格式的数据。
- 激活函数:选择ReLU或Tanh,以处理非线性特征。
- 正向传播:输入直接连接到下一个节点层。
中间层
- 节点数:根据任务需求调整,如128-512节点,以适应不同的输入特征。
- 结构:可能包含多个中间层,每个层的节点数和激活函数可以不同。
- 参数:节点数、权重数量、学习率、批量大小(如32、64、128)等。
- 训练:使用随机初始化的权重矩阵,通常为正态分布,均值为,标准差为.1。
- 正向传播:每个节点层的输出通过激活函数处理。
输出层
- 节点数:根据任务需求,如5-1个节点,用于分类或回归。
- 激活函数:ReLU或Tanh,输出被归一化为-1。
- 正向传播:将最后一个输出层的节点结果作为输出。
参数设置
- 节点数量:输入层、各中间层和输出层的节点数需调整以适应任务需求。
- 权重数量:计算为节点数x节点数,用于优化模型参数。
- 学习率:初始设置为.1,可能调整为.5-.1,根据训练效果优化。
- 批量大小:调整以平衡训练速度和稳定性,如32-128。
- 激活衰减率:1,控制激活函数衰减。
- 学习率初始化:正态分布,均值,标准差.1。
- 权重初始化:Gaussian分布,均值,标准差.1。
- 激活函数:选择ReLU、Tanh等,适应不同任务。
模型结构
- 输入层:7x7=49个节点。
- 第一个中间层:128个节点,激活函数ReLU,学习率.5,批量32。
- 第二个中间层:256个节点,激活函数Tanh,学习率.5,批量64。
- 第三个中间层:512个节点,激活函数ReLU,学习率.5,批量128。
- 输出层:5个节点,激活函数为Softmax,输出概率。
优化和调整
- 节点数调整:增加节点数提高模型精确度,但可能增加训练时间。
- 激活函数调整:ReLU适合表达式任务,Tanh适合非表达式任务。
- 学习率调整:减少学习率加快收敛,但可能影响收敛速度。
- 批量大小调整:增大批量提升训练稳定性,优化模型收敛。
通过调整节点数、激活函数、学习率和批量大小,SagerNet可以在不同任务和数据集上优化性能。




