vllm.model_executor.models.roberta ¶

BgeM3EmbeddingModel ¶

Bases: RobertaEmbeddingModel

A model that extends RobertaEmbeddingModel with sparse embeddings.

This class supports loading an additional sparse_linear.pt file to create sparse embeddings as described in https://arxiv.org/abs/2402.03216

Source code in vllm/model_executor/models/roberta.py

class BgeM3EmbeddingModel(RobertaEmbeddingModel):
    """A model that extends RobertaEmbeddingModel with sparse embeddings.

    This class supports loading an additional sparse_linear.pt file
    to create sparse embeddings as described in https://arxiv.org/abs/2402.03216
    """

    def __init__(self, *, vllm_config: VllmConfig, prefix: str = ""):
        self.hidden_size = vllm_config.model_config.hf_config.hidden_size

        model_config = vllm_config.model_config
        self.head_dtype = model_config.head_dtype
        self.bos_token_id = model_config.hf_config.bos_token_id
        self.eos_token_id = model_config.hf_config.eos_token_id

        super().__init__(vllm_config=vllm_config, prefix=prefix)
        self.secondary_weight_prefixes = ["sparse_linear.", "colbert_linear."]
        self.secondary_weight_files = [
            prefix + "pt" for prefix in self.secondary_weight_prefixes
        ]

        self.secondary_weights = [
            DefaultModelLoader.Source(
                model_or_path=vllm_config.model_config.model,
                revision=None,
                prefix=prefix,
                allow_patterns_overrides=[filename],
            )
            for filename, prefix in zip(
                self.secondary_weight_files, self.secondary_weight_prefixes
            )
        ]

    def _build_pooler(self, pooler_config: PoolerConfig) -> Pooler:
        self.sparse_linear = nn.Linear(self.hidden_size, 1, dtype=self.head_dtype)
        self.colbert_linear = nn.Linear(
            self.hidden_size, self.hidden_size, dtype=self.head_dtype
        )

        return DispatchPooler(
            {
                "embed": pooler_for_embed(pooler_config),
                "token_embed": BOSEOSFilter(
                    pooler_for_token_embed(pooler_config, self.colbert_linear),
                    self.bos_token_id,
                    # for some reason m3 only filters the bos for colbert vectors
                ),
                "token_classify": BOSEOSFilter(
                    pooler_for_token_classify(
                        pooler_config,
                        pooling=AllPool(),
                        classifier=self.sparse_linear,
                        act_fn=torch.relu,
                    ),
                    self.bos_token_id,
                    self.eos_token_id,
                ),
            }
        )

    def load_weights(self, all_weights: Iterable[tuple[str, torch.Tensor]]):
        secondary, weights = filter_secondary_weights(
            all_weights, self.secondary_weight_prefixes
        )

        super().load_weights(weights)

        params_dict = dict(self.named_parameters())

        for name, loaded_weight in secondary:
            if any(
                name.startswith(prefix) for prefix in self.secondary_weight_prefixes
            ):
                param = params_dict[name]
                weight_loader = getattr(param, "weight_loader", default_weight_loader)
                weight_loader(param, loaded_weight)

bos_token_id `instance-attribute` ¶

bos_token_id = bos_token_id

eos_token_id `instance-attribute` ¶

eos_token_id = eos_token_id

head_dtype `instance-attribute` ¶

head_dtype = head_dtype

hidden_size `instance-attribute` ¶

hidden_size = hidden_size

secondary_weight_files `instance-attribute` ¶

secondary_weight_files = [
    (prefix + "pt")
    for prefix in (secondary_weight_prefixes)
]

secondary_weight_prefixes `instance-attribute` ¶

secondary_weight_prefixes = [
    "sparse_linear.",
    "colbert_linear.",
]

secondary_weights `instance-attribute` ¶

secondary_weights = [
    (
        Source(
            model_or_path=model,
            revision=None,
            prefix=prefix,
            allow_patterns_overrides=[filename],
        )
    )
    for filename, prefix in (
        zip(
            secondary_weight_files,
            secondary_weight_prefixes,
        )
    )
]

init ¶

__init__(*, vllm_config: VllmConfig, prefix: str = '')

Source code in vllm/model_executor/models/roberta.py

def __init__(self, *, vllm_config: VllmConfig, prefix: str = ""):
    self.hidden_size = vllm_config.model_config.hf_config.hidden_size

    model_config = vllm_config.model_config
    self.head_dtype = model_config.head_dtype
    self.bos_token_id = model_config.hf_config.bos_token_id
    self.eos_token_id = model_config.hf_config.eos_token_id

    super().__init__(vllm_config=vllm_config, prefix=prefix)
    self.secondary_weight_prefixes = ["sparse_linear.", "colbert_linear."]
    self.secondary_weight_files = [
        prefix + "pt" for prefix in self.secondary_weight_prefixes
    ]

    self.secondary_weights = [
        DefaultModelLoader.Source(
            model_or_path=vllm_config.model_config.model,
            revision=None,
            prefix=prefix,
            allow_patterns_overrides=[filename],
        )
        for filename, prefix in zip(
            self.secondary_weight_files, self.secondary_weight_prefixes
        )
    ]

_build_pooler ¶

_build_pooler(pooler_config: PoolerConfig) -> Pooler

Source code in vllm/model_executor/models/roberta.py

def _build_pooler(self, pooler_config: PoolerConfig) -> Pooler:
    self.sparse_linear = nn.Linear(self.hidden_size, 1, dtype=self.head_dtype)
    self.colbert_linear = nn.Linear(
        self.hidden_size, self.hidden_size, dtype=self.head_dtype
    )

    return DispatchPooler(
        {
            "embed": pooler_for_embed(pooler_config),
            "token_embed": BOSEOSFilter(
                pooler_for_token_embed(pooler_config, self.colbert_linear),
                self.bos_token_id,
                # for some reason m3 only filters the bos for colbert vectors
            ),
            "token_classify": BOSEOSFilter(
                pooler_for_token_classify(
                    pooler_config,
                    pooling=AllPool(),
                    classifier=self.sparse_linear,
                    act_fn=torch.relu,
                ),
                self.bos_token_id,
                self.eos_token_id,
            ),
        }
    )

load_weights ¶

load_weights(all_weights: Iterable[tuple[str, Tensor]])

Source code in vllm/model_executor/models/roberta.py

def load_weights(self, all_weights: Iterable[tuple[str, torch.Tensor]]):
    secondary, weights = filter_secondary_weights(
        all_weights, self.secondary_weight_prefixes
    )

    super().load_weights(weights)

    params_dict = dict(self.named_parameters())

    for name, loaded_weight in secondary:
        if any(
            name.startswith(prefix) for prefix in self.secondary_weight_prefixes
        ):
            param = params_dict[name]
            weight_loader = getattr(param, "weight_loader", default_weight_loader)
            weight_loader(param, loaded_weight)

RobertaClassificationHead ¶

Bases: Module

Head for sentence-level classification tasks.

Source code in vllm/model_executor/models/roberta.py

class RobertaClassificationHead(nn.Module):
    """Head for sentence-level classification tasks."""

    def __init__(self, model_config: "ModelConfig"):
        super().__init__()
        config = model_config.hf_config
        head_dtype = model_config.head_dtype
        self.dense = nn.Linear(config.hidden_size, config.hidden_size, dtype=head_dtype)
        self.out_proj = nn.Linear(
            config.hidden_size, config.num_labels, dtype=head_dtype
        )

    def forward(self, x: torch.Tensor) -> torch.Tensor:
        # Token extraction has already been applied in `pooler.pooling`
        x = self.dense(x)
        x = torch.tanh(x)
        x = self.out_proj(x)
        return x

dense `instance-attribute` ¶

dense = Linear(hidden_size, hidden_size, dtype=head_dtype)

out_proj `instance-attribute` ¶

out_proj = Linear(hidden_size, num_labels, dtype=head_dtype)

init ¶

__init__(model_config: ModelConfig)

Source code in vllm/model_executor/models/roberta.py

def __init__(self, model_config: "ModelConfig"):
    super().__init__()
    config = model_config.hf_config
    head_dtype = model_config.head_dtype
    self.dense = nn.Linear(config.hidden_size, config.hidden_size, dtype=head_dtype)
    self.out_proj = nn.Linear(
        config.hidden_size, config.num_labels, dtype=head_dtype
    )

forward ¶

forward(x: Tensor) -> Tensor

Source code in vllm/model_executor/models/roberta.py

def forward(self, x: torch.Tensor) -> torch.Tensor:
    # Token extraction has already been applied in `pooler.pooling`
    x = self.dense(x)
    x = torch.tanh(x)
    x = self.out_proj(x)
    return x

RobertaEmbedding ¶

Bases: Module

Source code in vllm/model_executor/models/roberta.py

class RobertaEmbedding(nn.Module):
    def __init__(self, config: RobertaConfig):
        super().__init__()
        self.size = config.hidden_size
        self.word_embeddings = VocabParallelEmbedding(
            config.vocab_size, config.hidden_size
        )
        self.padding_idx = config.pad_token_id
        self.position_embeddings = nn.Embedding(
            config.max_position_embeddings,
            config.hidden_size,
            padding_idx=self.padding_idx,
        )

        self.token_type_embeddings = nn.Embedding(
            config.type_vocab_size, config.hidden_size
        )
        self.LayerNorm = nn.LayerNorm(config.hidden_size, eps=config.layer_norm_eps)
        self.register_buffer(
            "position_ids",
            torch.arange(config.max_position_embeddings).unsqueeze(0),
        )

    def forward(
        self,
        input_ids: torch.Tensor,
        position_ids: torch.Tensor,
        inputs_embeds: torch.Tensor | None = None,
    ) -> torch.Tensor:
        token_type_ids = _decode_token_type_ids(input_ids)

        if inputs_embeds is None:
            inputs_embeds = self.word_embeddings(input_ids)

        position_embeddings = self.position_embeddings(position_ids)

        token_type_embeddings = self.token_type_embeddings(token_type_ids)
        embeddings = inputs_embeds + token_type_embeddings + position_embeddings
        embeddings = self.LayerNorm(embeddings)
        return embeddings

LayerNorm `instance-attribute` ¶

LayerNorm = LayerNorm(hidden_size, eps=layer_norm_eps)

padding_idx `instance-attribute` ¶

padding_idx = pad_token_id

position_embeddings `instance-attribute` ¶

position_embeddings = Embedding(
    max_position_embeddings,
    hidden_size,
    padding_idx=padding_idx,
)

size `instance-attribute` ¶

size = hidden_size

token_type_embeddings `instance-attribute` ¶

token_type_embeddings = Embedding(
    type_vocab_size, hidden_size
)

word_embeddings `instance-attribute` ¶

word_embeddings = VocabParallelEmbedding(
    vocab_size, hidden_size
)

init ¶

__init__(config: RobertaConfig)

Source code in vllm/model_executor/models/roberta.py

def __init__(self, config: RobertaConfig):
    super().__init__()
    self.size = config.hidden_size
    self.word_embeddings = VocabParallelEmbedding(
        config.vocab_size, config.hidden_size
    )
    self.padding_idx = config.pad_token_id
    self.position_embeddings = nn.Embedding(
        config.max_position_embeddings,
        config.hidden_size,
        padding_idx=self.padding_idx,
    )

    self.token_type_embeddings = nn.Embedding(
        config.type_vocab_size, config.hidden_size
    )
    self.LayerNorm = nn.LayerNorm(config.hidden_size, eps=config.layer_norm_eps)
    self.register_buffer(
        "position_ids",
        torch.arange(config.max_position_embeddings).unsqueeze(0),
    )

forward ¶

forward(
    input_ids: Tensor,
    position_ids: Tensor,
    inputs_embeds: Tensor | None = None,
) -> Tensor

Source code in vllm/model_executor/models/roberta.py

def forward(
    self,
    input_ids: torch.Tensor,
    position_ids: torch.Tensor,
    inputs_embeds: torch.Tensor | None = None,
) -> torch.Tensor:
    token_type_ids = _decode_token_type_ids(input_ids)

    if inputs_embeds is None:
        inputs_embeds = self.word_embeddings(input_ids)

    position_embeddings = self.position_embeddings(position_ids)

    token_type_embeddings = self.token_type_embeddings(token_type_ids)
    embeddings = inputs_embeds + token_type_embeddings + position_embeddings
    embeddings = self.LayerNorm(embeddings)
    return embeddings

RobertaEmbeddingModel ¶

Bases: BertEmbeddingModel

A model that uses Roberta to provide embedding functionalities.

Source code in vllm/model_executor/models/roberta.py

@default_pooling_type(seq_pooling_type="CLS")
class RobertaEmbeddingModel(BertEmbeddingModel):
    """A model that uses Roberta to provide embedding functionalities."""

    def __init__(self, *, vllm_config: VllmConfig, prefix: str = ""):
        super().__init__(vllm_config=vllm_config, prefix=prefix)
        self.padding_idx: int = vllm_config.model_config.hf_config.pad_token_id

    def forward(
        self,
        input_ids: torch.Tensor,
        positions: torch.Tensor,
        intermediate_tensors: IntermediateTensors | None = None,
        inputs_embeds: torch.Tensor | None = None,
    ) -> torch.Tensor:
        # Fix Roberta positions here outside of the CUDA graph.
        # Because we need the to extract the sequences from
        # input_ids the control flow is data dependent.
        replace_roberta_positions(
            input_ids=input_ids, position_ids=positions, padding_idx=self.padding_idx
        )

        return self.model(
            input_ids=input_ids,
            positions=positions,
            inputs_embeds=inputs_embeds,
            intermediate_tensors=intermediate_tensors,
        )

    def _build_model(
        self, vllm_config: VllmConfig, prefix: str = ""
    ) -> BertModel | BertWithRope:
        hf_config = vllm_config.model_config.hf_config
        kwargs = dict(vllm_config=vllm_config, prefix=prefix)
        if getattr(hf_config, "position_embedding_type", "absolute") == "absolute":
            return BertModel(**kwargs, embedding_class=RobertaEmbedding)
        else:
            return JinaRobertaModel(**kwargs)

    def load_weights(self, weights: Iterable[tuple[str, torch.Tensor]]):
        weights_list = list(weights)
        has_roberta_prefix = any(
            name.startswith("roberta.") for name, _ in weights_list
        )
        if has_roberta_prefix:
            # For models with the `roberta.` prefix e.g.
            # `FacebookAI/roberta-base`
            mapper = WeightsMapper(orig_to_new_prefix={"roberta.": "model."})
        else:
            # For models without the `roberta.` prefix e.g.
            # `sentence-transformers/stsb-roberta-base-v2`
            mapper = WeightsMapper(orig_to_new_prefix={"": "model."})

        loader = AutoWeightsLoader(self, skip_prefixes=["lm_head."])
        return loader.load_weights(weights_list, mapper=mapper)

padding_idx `instance-attribute` ¶

padding_idx: int = pad_token_id

init ¶

__init__(*, vllm_config: VllmConfig, prefix: str = '')

Source code in vllm/model_executor/models/roberta.py

def __init__(self, *, vllm_config: VllmConfig, prefix: str = ""):
    super().__init__(vllm_config=vllm_config, prefix=prefix)
    self.padding_idx: int = vllm_config.model_config.hf_config.pad_token_id

_build_model ¶

_build_model(
    vllm_config: VllmConfig, prefix: str = ""
) -> BertModel | BertWithRope

Source code in vllm/model_executor/models/roberta.py

def _build_model(
    self, vllm_config: VllmConfig, prefix: str = ""
) -> BertModel | BertWithRope:
    hf_config = vllm_config.model_config.hf_config
    kwargs = dict(vllm_config=vllm_config, prefix=prefix)
    if getattr(hf_config, "position_embedding_type", "absolute") == "absolute":
        return BertModel(**kwargs, embedding_class=RobertaEmbedding)
    else:
        return JinaRobertaModel(**kwargs)

forward ¶

forward(
    input_ids: Tensor,
    positions: Tensor,
    intermediate_tensors: IntermediateTensors | None = None,
    inputs_embeds: Tensor | None = None,
) -> Tensor

Source code in vllm/model_executor/models/roberta.py

def forward(
    self,
    input_ids: torch.Tensor,
    positions: torch.Tensor,
    intermediate_tensors: IntermediateTensors | None = None,
    inputs_embeds: torch.Tensor | None = None,
) -> torch.Tensor:
    # Fix Roberta positions here outside of the CUDA graph.
    # Because we need the to extract the sequences from
    # input_ids the control flow is data dependent.
    replace_roberta_positions(
        input_ids=input_ids, position_ids=positions, padding_idx=self.padding_idx
    )

    return self.model(
        input_ids=input_ids,
        positions=positions,
        inputs_embeds=inputs_embeds,
        intermediate_tensors=intermediate_tensors,
    )

load_weights ¶

load_weights(weights: Iterable[tuple[str, Tensor]])

Source code in vllm/model_executor/models/roberta.py

def load_weights(self, weights: Iterable[tuple[str, torch.Tensor]]):
    weights_list = list(weights)
    has_roberta_prefix = any(
        name.startswith("roberta.") for name, _ in weights_list
    )
    if has_roberta_prefix:
        # For models with the `roberta.` prefix e.g.
        # `FacebookAI/roberta-base`
        mapper = WeightsMapper(orig_to_new_prefix={"roberta.": "model."})
    else:
        # For models without the `roberta.` prefix e.g.
        # `sentence-transformers/stsb-roberta-base-v2`
        mapper = WeightsMapper(orig_to_new_prefix={"": "model."})

    loader = AutoWeightsLoader(self, skip_prefixes=["lm_head."])
    return loader.load_weights(weights_list, mapper=mapper)

RobertaForSequenceClassification ¶

Bases: Module, SupportsCrossEncoding

A model that uses Roberta to provide embedding functionalities.

This class encapsulates the BertModel and provides an interface for embedding operations and customized pooling functions.

Attributes:

Name	Type	Description
`roberta`		An instance of BertModel used for forward operations.
`_pooler`		An instance of Pooler used for pooling operations.

Source code in vllm/model_executor/models/roberta.py

@default_pooling_type(seq_pooling_type="CLS")
class RobertaForSequenceClassification(nn.Module, SupportsCrossEncoding):
    """A model that uses Roberta to provide embedding functionalities.

    This class encapsulates the BertModel and provides an interface for
    embedding operations and customized pooling functions.

    Attributes:
        roberta: An instance of BertModel used for forward operations.
        _pooler: An instance of Pooler used for pooling operations.
    """

    is_pooling_model = True
    jina_to_vllm_mapper = WeightsMapper(
        orig_to_new_substr={
            "emb_ln": "embeddings.LayerNorm",
            "layers": "layer",
            "mixer.Wqkv": "attention.self.qkv_proj",
            "mixer.out_proj": "attention.output.dense",
            "norm1": "attention.output.LayerNorm",
            "mlp.fc1": "intermediate.dense",
            "mlp.fc2": "output.dense",
            "norm2": "output.LayerNorm",
        }
    )

    def __init__(self, *, vllm_config: VllmConfig, prefix: str = ""):
        super().__init__()
        config = vllm_config.model_config.hf_config
        self.padding_idx: int = vllm_config.model_config.hf_config.pad_token_id

        self.num_labels = config.num_labels
        self.roberta = BertModel(
            vllm_config=vllm_config,
            prefix=maybe_prefix(prefix, "bert"),
            embedding_class=RobertaEmbedding,
        )
        self.classifier = RobertaClassificationHead(vllm_config.model_config)

        pooler_config = vllm_config.model_config.pooler_config
        assert pooler_config is not None

        self.pooler = DispatchPooler.for_seq_cls(
            pooler_config,
            classifier=self.classifier,
        )

    def load_weights(self, weights: Iterable[tuple[str, torch.Tensor]]):
        loader = AutoWeightsLoader(self)
        return loader.load_weights(weights, mapper=self.jina_to_vllm_mapper)

    def embed_input_ids(self, input_ids: torch.Tensor) -> torch.Tensor:
        return self.roberta.embed_input_ids(input_ids)

    def forward(
        self,
        input_ids: torch.Tensor | None,
        positions: torch.Tensor,
        intermediate_tensors: IntermediateTensors | None = None,
        inputs_embeds: torch.Tensor | None = None,
        token_type_ids: torch.Tensor | None = None,
    ) -> torch.Tensor:
        replace_roberta_positions(
            input_ids=input_ids, position_ids=positions, padding_idx=self.padding_idx
        )
        if token_type_ids is not None:
            assert self.roberta.config.vocab_size < (1 << TOKEN_TYPE_SHIFT)
            assert input_ids is not None
            _encode_token_type_ids(input_ids, token_type_ids)
        return self.roberta(
            input_ids=input_ids,
            positions=positions,
            inputs_embeds=inputs_embeds,
            intermediate_tensors=intermediate_tensors,
        )

classifier `instance-attribute` ¶

classifier = RobertaClassificationHead(model_config)

is_pooling_model `class-attribute` `instance-attribute` ¶

is_pooling_model = True

jina_to_vllm_mapper `class-attribute` `instance-attribute` ¶

jina_to_vllm_mapper = WeightsMapper(
    orig_to_new_substr={
        "emb_ln": "embeddings.LayerNorm",
        "layers": "layer",
        "mixer.Wqkv": "attention.self.qkv_proj",
        "mixer.out_proj": "attention.output.dense",
        "norm1": "attention.output.LayerNorm",
        "mlp.fc1": "intermediate.dense",
        "mlp.fc2": "output.dense",
        "norm2": "output.LayerNorm",
    }
)

num_labels `instance-attribute` ¶

num_labels = num_labels

padding_idx `instance-attribute` ¶

padding_idx: int = pad_token_id

pooler `instance-attribute` ¶

pooler = for_seq_cls(pooler_config, classifier=classifier)

roberta `instance-attribute` ¶

roberta = BertModel(
    vllm_config=vllm_config,
    prefix=maybe_prefix(prefix, "bert"),
    embedding_class=RobertaEmbedding,
)

init ¶

__init__(*, vllm_config: VllmConfig, prefix: str = '')

Source code in vllm/model_executor/models/roberta.py

def __init__(self, *, vllm_config: VllmConfig, prefix: str = ""):
    super().__init__()
    config = vllm_config.model_config.hf_config
    self.padding_idx: int = vllm_config.model_config.hf_config.pad_token_id

    self.num_labels = config.num_labels
    self.roberta = BertModel(
        vllm_config=vllm_config,
        prefix=maybe_prefix(prefix, "bert"),
        embedding_class=RobertaEmbedding,
    )
    self.classifier = RobertaClassificationHead(vllm_config.model_config)

    pooler_config = vllm_config.model_config.pooler_config
    assert pooler_config is not None

    self.pooler = DispatchPooler.for_seq_cls(
        pooler_config,
        classifier=self.classifier,
    )

embed_input_ids ¶

embed_input_ids(input_ids: Tensor) -> Tensor

Source code in vllm/model_executor/models/roberta.py

def embed_input_ids(self, input_ids: torch.Tensor) -> torch.Tensor:
    return self.roberta.embed_input_ids(input_ids)

forward ¶

forward(
    input_ids: Tensor | None,
    positions: Tensor,
    intermediate_tensors: IntermediateTensors | None = None,
    inputs_embeds: Tensor | None = None,
    token_type_ids: Tensor | None = None,
) -> Tensor

Source code in vllm/model_executor/models/roberta.py

def forward(
    self,
    input_ids: torch.Tensor | None,
    positions: torch.Tensor,
    intermediate_tensors: IntermediateTensors | None = None,
    inputs_embeds: torch.Tensor | None = None,
    token_type_ids: torch.Tensor | None = None,
) -> torch.Tensor:
    replace_roberta_positions(
        input_ids=input_ids, position_ids=positions, padding_idx=self.padding_idx
    )
    if token_type_ids is not None:
        assert self.roberta.config.vocab_size < (1 << TOKEN_TYPE_SHIFT)
        assert input_ids is not None
        _encode_token_type_ids(input_ids, token_type_ids)
    return self.roberta(
        input_ids=input_ids,
        positions=positions,
        inputs_embeds=inputs_embeds,
        intermediate_tensors=intermediate_tensors,
    )

load_weights ¶

load_weights(weights: Iterable[tuple[str, Tensor]])

Source code in vllm/model_executor/models/roberta.py

def load_weights(self, weights: Iterable[tuple[str, torch.Tensor]]):
    loader = AutoWeightsLoader(self)
    return loader.load_weights(weights, mapper=self.jina_to_vllm_mapper)

filter_secondary_weights ¶

filter_secondary_weights(
    all_weights: Iterable[tuple[str, Tensor]],
    secondary_weights: list[str],
) -> tuple[
    Iterable[tuple[str, Tensor]],
    Iterable[tuple[str, Tensor]],
]

Source code in vllm/model_executor/models/roberta.py

def filter_secondary_weights(
    all_weights: Iterable[tuple[str, torch.Tensor]],
    secondary_weights: list[str],
) -> tuple[Iterable[tuple[str, torch.Tensor]], Iterable[tuple[str, torch.Tensor]]]:
    all_weights1, all_weights2 = itertools.tee(all_weights)

    def filtered(n):
        return any(n.startswith(f) for f in secondary_weights)

    return ((n, w) for n, w in all_weights1 if filtered(n)), (
        (n, w) for n, w in all_weights2 if not filtered(n)
    )

replace_roberta_positions ¶

replace_roberta_positions(
    input_ids: Tensor,
    position_ids: Tensor,
    padding_idx: int,
) -> None

Source code in vllm/model_executor/models/roberta.py

def replace_roberta_positions(
    input_ids: torch.Tensor, position_ids: torch.Tensor, padding_idx: int
) -> None:
    # Replace position ids because in RoBERTa models
    # they have to start at padding_idx + 1 and ignore
    # existing padding tokens
    # References:
    # - https://github.com/huggingface/transformers/blob/a3d69a8994d673899608a7c17fbf4f953f50474e/src/transformers/models/roberta/modeling_roberta.py#L133
    # - https://github.com/huggingface/transformers/blob/a3d69a8994d673899608a7c17fbf4f953f50474e/src/transformers/models/roberta/modeling_roberta.py#L1669
    # vllm does not use padding tokens, let's make things simpler
    position_ids += padding_idx + 1

vllm.model_executor.models.roberta ¶

BgeM3EmbeddingModel ¶

bos_token_id instance-attribute ¶

eos_token_id instance-attribute ¶

head_dtype instance-attribute ¶

hidden_size instance-attribute ¶

secondary_weight_files instance-attribute ¶

secondary_weight_prefixes instance-attribute ¶

secondary_weights instance-attribute ¶

__init__ ¶

_build_pooler ¶

load_weights ¶

RobertaClassificationHead ¶

dense instance-attribute ¶

out_proj instance-attribute ¶

__init__ ¶

forward ¶

RobertaEmbedding ¶

LayerNorm instance-attribute ¶

padding_idx instance-attribute ¶

position_embeddings instance-attribute ¶

size instance-attribute ¶

token_type_embeddings instance-attribute ¶

word_embeddings instance-attribute ¶

__init__ ¶

forward ¶

RobertaEmbeddingModel ¶

padding_idx instance-attribute ¶

__init__ ¶

_build_model ¶

forward ¶

load_weights ¶

RobertaForSequenceClassification ¶

classifier instance-attribute ¶

is_pooling_model class-attribute instance-attribute ¶

jina_to_vllm_mapper class-attribute instance-attribute ¶

num_labels instance-attribute ¶

padding_idx instance-attribute ¶

pooler instance-attribute ¶

roberta instance-attribute ¶

__init__ ¶

embed_input_ids ¶

forward ¶

load_weights ¶

filter_secondary_weights ¶

replace_roberta_positions ¶

bos_token_id `instance-attribute` ¶

eos_token_id `instance-attribute` ¶

head_dtype `instance-attribute` ¶

hidden_size `instance-attribute` ¶

secondary_weight_files `instance-attribute` ¶

secondary_weight_prefixes `instance-attribute` ¶

secondary_weights `instance-attribute` ¶

init ¶

dense `instance-attribute` ¶

out_proj `instance-attribute` ¶

init ¶

LayerNorm `instance-attribute` ¶

padding_idx `instance-attribute` ¶

position_embeddings `instance-attribute` ¶

size `instance-attribute` ¶

token_type_embeddings `instance-attribute` ¶

word_embeddings `instance-attribute` ¶

init ¶

padding_idx `instance-attribute` ¶

init ¶

classifier `instance-attribute` ¶

is_pooling_model `class-attribute` `instance-attribute` ¶

jina_to_vllm_mapper `class-attribute` `instance-attribute` ¶

num_labels `instance-attribute` ¶

padding_idx `instance-attribute` ¶

pooler `instance-attribute` ¶

roberta `instance-attribute` ¶

init ¶