GPT Image-2 - Text to Image

Prompt

\section{系统模型} \subsection{框架下的FL} 我们考虑由一个边缘服务器和$K \ (k \in \{1, 2, \dots, K\})$个终端设备组成的联邦学习系统。第 $k$ 个边缘设备拥有数据集 $\mathcal{D}_k$,其中 $|\mathcal{D}_k|$ 代表数据样本的数量。 每个设备 $k$ 拥有一个本地数据集 $\mathcal{D}_k$,包含 $|\mathcal{D}_k|$ 个数据样本。所有本地数据集构成全部的数据集,即 $\mathcal{D} = \cup_{k=1}^K \mathcal{D}_k$,且总数据样本数为 $|\mathcal{D}| = \sum_{k=1}^K |\mathcal{D}_k|$。对于任意数据样本 $\zeta = (x, y) \in \mathcal{D}$,我们使用损失函数 $f(x, y;\omega)$来度量模型 $\omega$ 在样本上的预测误差,同时$\omega$有$N$个参数。设备 $k$ 的局部损失函数 $F_k(\omega)$ 定义为: $F_k(\omega) = \frac{1}{|\mathcal{D}_k|} \sum_{(x, y) \in \mathcal{D}_k} f(x, y; \omega)$,整个联邦学习系统的优化目标可以被形式化地表述为求解以下最小化问题:$\min_{\omega} F(\omega)=\sum_{k=1}^{K-1} a_k F_k(\omega)$。 其中权重 $a_k$ 代表了设备$k$的模型在全局模型更新中的相对重要性,其中 $a_k \geq 0$ 且 $\sum_{k=1}^K a_k = 1$。 为了提高联邦学习(FL)的通信和计算效率,本文提出了一种模型剪枝的同步联邦学习框架,用于生成适应设备异构能力的子模型来供设备进行本地推理。在同步联邦学习中,每一轮全局训练的持续时间由参与设备中完成本地训练和模型上传最慢的设备决定。由于设备计算资源异构、无线信道随时间变化、设备移动以及电量波动等因素,部分设备可能无法在规定的时延约束内完成本地训练和模型上传。这些不可靠设备会成为掉队设备,从而显著增加同步联邦学习的等待时延。为缓解上述问题,本文在边缘服务器端为每个设备构建对应的数字孪生,并利用数字孪生预测该设备成功完成下一轮训练任务的概率。基于预测得到的设备可用性,边缘服务器选择一组可靠设备参与联邦训练,并为每个参与设备确定个性化的模型剪枝率和带宽分配比例。我们使用 $m_{k,t}^{i}$ 表示第 $t$ 轮设备 $k$ 对应的剪枝掩码, 其中 $i=\{1,2,\cdots,N\}$。 当 $m_{k,t}^{i}=1$ 时,表示全局模型的第 $i$ 个区域在设备 $k$ 的子模型中被保留; 当 $m_{k,t}^{i}=0$ 时,表示该区域被裁剪。则剪枝率$ \Psi_{k,t}=1-\frac{1}{N}\sum_{i=1}^{N}m_{k,t}^{i}$。 联邦学习过程包含T轮全局训练,每一轮$t \ (t \in \{ 1, 2,\dots, T - 1\})$的过程为: \begin{enumerate} \item \textbf{模型剪枝比率的确定}:在第 $t$ 轮开始时,每个设备将其最新的状态上传至其数字孪生(DT)。DT 将确定剪枝比率 $\Psi_{k}^{t}$,其细节将在后续详细说明。随后,每个 DT 将全局模型 ${\omega}_{k}^{t}$ 及剪枝比率 $\Psi_{k}^{t}$ 传输至其设备。 \item \textbf{本地训练}:设备 $k$ 在数据集 $\mathcal{D}_k$ 上对接收到的模型 ${\omega}_{k}^{t}$ 进行 $\lambda_k$ 次本地迭代训练。\item \textbf{本地模型剪枝}:基于接收到的 $\Psi_{k}^{t}$,设备 $k$ 对模型 ${\omega}_{k}^{t}$ 进行剪枝\item \textbf{模型上传}:一旦完成本地模型训练,设备应将其模型传输至 DT。\item \textbf{全局聚合}:在接收到所有本地模型后,边缘服务器在每个轮次$t$ 进行聚合。\item \textbf{模型分发}:在下一个全局训练轮,边缘服务器将聚合模型传输给 DTs和设备,并启动下一个学习过程。\subsection{设备预测} 为避免同步联邦学习中因设备资源耗尽而掉线所导致的长时间等待,本文训练一个任务完成预测模型,依据设备当前的CPU负载、电量及网络状态等,判断其是否无法完成训练。若模型预测设备在下一轮完成联邦学习训练的概率低于预设阈值,则本轮不将该设备纳入参与集合。考虑到设备端的计算与能量资源有限,该预测模型的训练过程不宜直接在真实设备上执行,而需在边缘服务器上的数字孪生环境完成。如文献所述,设备有本地计算任务,用于联邦学习任务的最大计算资源是变化的。对于设备 $k$,使用$L$个时刻的状态: $ \mathbf{X}_{k,\ell} = \left[ \mathbf{x}_{k,\ell-L+1}, \ldots, \mathbf{x}_{k,\ell} \right], $ 每个时刻$\ell$的状态可以表示为: $ \mathbf{x}_{k,\ell}= \left[ \text{带宽}, \text{网络情况}, \text{距离}, \mathrm{CPU}\text{负载}, \text{内存负载}, \text{电量}, \text{剪枝率} \right], $ 输入张量的形状为: $ \mathbf{X} \in \mathbb{R}^{B \times L \times F}, $ 批量大小 B ,窗口 L ,特征数量 F。 由于不同输入特征的含义和数量级差异很大,在编码层之前,对$\mathbf{x}_{k,\ell}$执行 Z-score 标准化,以消除数量级差异,提升训练稳定性。然后,通过一个编码层将标准化后的特征映射到统一的特征空间,使不同类型的信息转换到可比较的表示下: $ \mathbf{z}_{k,\ell} = \operatorname{ReLU}\left( \mathbf{W}_e \mathbf{x}_{k,\ell} + \mathbf{b}_e \right), $ 其中$\mathbf{W}_e \in \mathbb{R}^{d_z \times F}$是编码层的权重矩阵($d_z$ 是编码后的特征维度,$F$是原始输入特征数),它对原始输入特征 \(\mathbf{x}_{k,\ell}\) 进行线性变换,将不同语义的原始特征映射到统一维度的特征空间中;$\mathbf{b}_e \in \mathbb{R}^{d_z \times 1}$是编码层的偏置向量,在线性变换的基础上提供偏移,并与后续的\(\operatorname{ReLU}\) 激活函数配合,增强模型的非线性表达能力。 不同设备状态特征对设备能否完成下一轮联邦学习任务的影响并不相同,并且各特征的重要程度会随设备当前运行状态动态变化。例如,当设备剩余电量较低时,电量和 CPU 负载可能成为影响任务完成的主要因素;当网络连接不稳定时,带宽和网络状态对预测结果的影响可能更加显著。因此,本文引入特征注意力机制,对每个时刻的不同输入特征进行自适应加权,从而突出与设备任务完成概率密切相关的状态信息。确切地说,对第$k$个设备在第$\ell$个时间步的编码特征$ \mathbf{z}_{k,\ell} \in \mathbb{R}^{d_z \times 1} $逐维度$m$计算内容匹配得分$s_{k,\ell,m}= \mathbf{q}_f^{\top} \tanh\left( \mathbf{W}_f\mathbf{z}_{k,\ell,m} +\mathbf{b}_f \right)$, 其中$z_{k,\ell,m}$ 为$\mathbf{z}_{k,\ell}$的第 $m$ 维分量; $\mathbf{W}_f\in\mathbb{R}^{d_a\times1}$和$\mathbf{b}_f\in\mathbb{R}^{d_a\times1}$ 为特征维度的线性变换参数,负责将单维特征映射到$d_a$维的注意力计算空间; $\mathbf{q}_f\in\mathbb{R}^{d_a\times1}$ 一个可训练的查询向量,衡量每一维特征与任务完成概率之间的相关性。对各维度得分做进行Softmax 归一化,得到该时刻特征维度的注意力权重 $\beta_{k,\ell,m} = \frac{\exp(s_{k,\ell,m})} {\sum_{n=1}^{d_z}\exp(s_{k,\ell,n})}$。最终,经过注意力加权后的特征向量表示$\tilde{\mathbf{z}}_{k,\ell} = \boldsymbol{\beta}_{k,\ell}\odot\mathbf{z}_{k,\ell}$,其中 $\boldsymbol{\beta}_{k,\ell} = [\beta_{k,\ell,1},\beta_{k,\ell,2},\ldots,\beta_{k,\ell,d_z}]^{\top}$, $\odot$ 为逐元素相乘。为捕捉设备状态在时间上的演变规律,将$L$个时间步的特征序列输入时序编码器。考虑到 GRU 参数更少、训练更快且对中小规模数据更为友好,本文选择 GRU 进行时序建模: $ \left( \mathbf{h}_{k,1}, \mathbf{h}_{k,2}, \ldots, \mathbf{h}_{k,L} \right) = \operatorname{GRU}\left( \tilde{\mathbf{z}}_{k,1}, \tilde{\mathbf{z}}_{k,2}, \ldots, \tilde{\mathbf{z}}_{k,L} \right) $。 然而,不同历史时刻对最终预测的贡献并不相同,仅使用最后一步的隐藏状态可能无法充分捕获长时间依赖中的关键片段。因此,引入时间维度的注意力机制,以自适应地聚焦于重要的历史状态。对于每个时间步$\ell$将其隐藏状态 $\mathbf{h}_{k,\ell}$作为查询,与所有$L$个历史隐藏状态进行缩放点积注意力计算 $e_{k,\ell,j} = \frac{\mathbf{h}_{k,L}^{\top}\mathbf{h}_{k,j}} {\sqrt{d_h}}, \quad \ell=1,2,\dots,L$ 其中$\sqrt{d_h}$ 为缩放因子,用于平衡状态维度 $d_h$ 对数值范围的影响。经 Softmax 归一化后,得到注意力权重$\alpha_{k,\ell,j}=\frac{\exp(e_{k,\ell,j})}{\sum_{l=1}^{L}\exp(e_{k,\ell,l})}$,并对所有历史隐藏状态加权求和,生成该时刻的上下文向量$\mathbf{c}_{k,\ell}=\sum_{l=1}^{L}\alpha_{k,\ell,l}\mathbf{h}_{k,l}$。 \textcolor{red}{上下文向量$\mathbf{c}_{k,\ell}$是注意力机制对历史窗口内各时刻隐藏状态进行自适应加权聚合的结果。该机制根据不同历史状态与当前预测任务的相关性动态分配权重,从而突出关键时刻的信息。尽管$\mathbf{c}_{k,\ell}$ 能够表征跨时间的依赖关系,但加权聚合过程更侧重于全局时序信息的概括,因此,当前时刻所包含的部分局部或瞬时状态特征可能会被平滑或弱化。}为此,我们将上下文向量与该时间步的原始编码特征$\mathbf{z}_{k,\ell}$进行拼接,得到最终的表征: $ \mathbf{r}_{k,\ell} = \left[ \mathbf{c}_{k,\ell}; \mathbf{z}_{k,\ell} \right]. $ \textcolor{red}{该表征兼顾了观测窗口内的状态演化规律与当前时刻的具体运行特征,使模型能够同时刻画设备近期状态的变化过程和当前所处状态,从而为设备预测提供更加全面且具有判别力的特征信息。} 模型输出概率 $ \hat{p}_{k,\ell+1} = \sigma\left( f_{\mathrm{pred}}\left(\mathbf{r}_{k,\ell}\right) \right), $ 其中$f_{\mathrm{pred}}\left(\cdot\right)$是基于多层感知机(MLP)的预测输出头,用于将时序编码器与注意力机制输出的抽象状态表征映射为预测分数。$\sigma(\cdot)$为Sigmoid 激活函数,将预测头输出的任意实数值压缩映射到\([0,1]\)区间。 由于预测目标为设备能否成功完成训练的二元变量,且模型输出为归一化概率 ,本文采用二元交叉熵(Binary Cross-Entropy)作为损失函数,表达式如下: \begin{equation} \mathcal{L} = -\frac{1}{M} \sum_{m=1}^{M} \left[ y_m \log \hat{p}_m + \left(1-y_m\right) \log\left(1-\hat{p}_m\right) \right], \end{equation} 其中m表示样本数索引,$y_m$表示真实标签,则在第$t$轮中所选客户端 $ s_k^t = \left\{ k \,\middle|\, \hat{p}_{k,t} > \tau \right\} $, $\tau$ 是预设的阈值。定义设备 $k$ 在第 $t$ 轮的选择指示变量为 $s_{k,t}\in\{0,1\}$, 其中 $s_{k,t}=1$ 表示设备 $k$ 被选中参与训练, 而 $s_{k,t}=0$ 表示设备 $k$ 未被选中。 为训练上述任务完成预测模型,需要充足的设备状态数据与标签标注。然而,在真实设备上采集大规模训练数据会消耗设备本就有限的计算与能量资源。为此,本文在边缘服务器上为每个设备构建独立的数字孪生体,采用“仿真预训练+真实数据微调”的策略:首先,利用数字孪生环境生成模拟的设备状态序列与对应的标签标注,对预测模型进行预训练,以获得良好的初始参数;随后,在联邦学习运行过程中,将设备周期性上报的真实状态数据注入数字孪生,对模型进行在线微调,使其逐步适应实际环境的变化。该方式既避免了占用设备资源,又能结合仿真数据的多样性与真实数据的真实性,提升预测的准确性。

image

GPT Image-2 - Text to Image

GPT Image-2image:gpt-image-2-text-to-imageImage generation
Aug 7, 2026, 07:38 AM

Settings

Provider
GPT Image-2
Model
image:gpt-image-2-text-to-image
Created
Aug 7, 2026, 07:38 AM
Credits
3
Mode
Image generation
Aspect ratio
auto
Resolution
1K

Create Something Similar

The generator below preselects the model used for this record so you can remix the idea faster.

Generate Image
New tasks appear here after you submit.