1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50
| class LSHAttention(nn.Module): def __init__(self, dim, n_heads, n_hashes=4): super().__init__() self.dim = dim self.n_heads = n_heads self.head_dim = dim // n_heads self.n_hashes = n_hashes self.wq = nn.Linear(dim, dim, bias=False) self.wk = nn.Linear(dim, dim, bias=False) self.wv = nn.Linear(dim, dim, bias=False) self.wo = nn.Linear(dim, dim, bias=False) self.hash_vectors = nn.Parameter(torch.randn(n_heads, self.head_dim)) def forward(self, x): batch_size, seq_len, _ = x.shape q = self.wq(x).view(batch_size, seq_len, self.n_heads, self.head_dim) k = self.wk(x).view(batch_size, seq_len, self.n_heads, self.head_dim) v = self.wv(x).view(batch_size, seq_len, self.n_heads, self.head_dim) q_hash = torch.matmul(q, self.hash_vectors.unsqueeze(0).unsqueeze(2)) k_hash = torch.matmul(k, self.hash_vectors.unsqueeze(0).unsqueeze(2)) q_sorted, q_indices = torch.sort(q_hash, dim=1) k_sorted, k_indices = torch.sort(k_hash, dim=1) output = torch.zeros_like(v) for i in range(seq_len): same_bucket = (q_hash[:, i, :, :] == k_hash).any(dim=1) attn = torch.matmul(q[:, i:i+1, :, :], k.transpose(-2, -1)) attn = attn.masked_fill(~same_bucket.unsqueeze(1).unsqueeze(2), float("-inf")) attn = F.softmax(attn, dim=-1) out = torch.matmul(attn, v) output[:, i, :, :] = out[:, 0, :, :] output = output.transpose(1, 2).contiguous() output = output.view(batch_size, seq_len, -1) return self.wo(output)
|