1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56
| class AdaptiveDifferentialAttention(nn.Module): def __init__(self, dim, n_heads): super().__init__() self.dim = dim self.n_heads = n_heads self.head_dim = dim // n_heads self.wq = nn.Linear(dim, dim, bias=False) self.wk = nn.Linear(dim, dim, bias=False) self.wv = nn.Linear(dim, dim, bias=False) self.lambda_q1 = nn.Parameter(torch.randn(n_heads, self.head_dim)) self.lambda_k1 = nn.Parameter(torch.randn(n_heads, self.head_dim)) self.lambda_q2 = nn.Parameter(torch.randn(n_heads, self.head_dim)) self.lambda_k2 = nn.Parameter(torch.randn(n_heads, self.head_dim)) self.gate = nn.Sequential( nn.Linear(dim, dim // 4), nn.GELU(), nn.Linear(dim // 4, dim), nn.Sigmoid() ) self.wo = nn.Linear(dim, dim, bias=False) def forward(self, x, mask=None): batch_size, seq_len, _ = x.shape q = self.wq(x).view(batch_size, seq_len, self.n_heads, self.head_dim) k = self.wk(x).view(batch_size, seq_len, self.n_heads, self.head_dim) v = self.wv(x).view(batch_size, seq_len, self.n_heads, self.head_dim) q = q.transpose(1, 2) k = k.transpose(1, 2) v = v.transpose(1, 2) attn1 = torch.matmul(q * self.lambda_q1, (k * self.lambda_k1).transpose(-2, -1)) attn2 = torch.matmul(q * self.lambda_q2, (k * self.lambda_k2).transpose(-2, -1)) attn = F.softmax(attn1, dim=-1) - F.softmax(attn2, dim=-1) output = torch.matmul(attn, v) gate = self.gate(x) output = output.transpose(1, 2).contiguous() output = output.view(batch_size, seq_len, -1) output = output * gate return self.wo(output)
|