Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
109 changes: 78 additions & 31 deletions src/sagemaker/serve/builder/jumpstart_builder.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -23,6 +23,7 @@
from sagemaker import model_uris
from sagemaker.serve.model_server.djl_serving.prepare import prepare_djl_js_resources
from sagemaker.serve.model_server.djl_serving.utils import _get_admissible_tensor_parallel_degrees
from sagemaker.serve.model_server.multi_model_server.prepare import prepare_mms_js_resources
from sagemaker.serve.model_server.tgi.prepare import prepare_tgi_js_resources, _create_dir_structure
from sagemaker.serve.mode.function_pointers import Mode
from sagemaker.serve.utils.exceptions import (
Expand All@@ -35,6 +36,7 @@
from sagemaker.serve.utils.predictors import (
DjlLocalModePredictor,
TgiLocalModePredictor,
TransformersLocalModePredictor,
)
from sagemaker.serve.utils.local_hardware import (
_get_nb_instance,
Expand DownExpand Up@@ -90,6 +92,7 @@ def __init__(self):
self.existing_properties = None
self.prepared_for_tgi = None
self.prepared_for_djl = None
self.prepared_for_mms = None
self.schema_builder = None
self.nb_instance_type = None
self.ram_usage_model_load = None
Expand DownExpand Up@@ -137,7 +140,11 @@ def _js_builder_deploy_wrapper(self, *args, **kwargs) -> Type[PredictorBase]:

if overwrite_mode == Mode.SAGEMAKER_ENDPOINT:
self.mode = self.pysdk_model.mode = Mode.SAGEMAKER_ENDPOINT
if not hasattr(self, "prepared_for_djl") or not hasattr(self, "prepared_for_tgi"):
if (
not hasattr(self, "prepared_for_djl")
or not hasattr(self, "prepared_for_tgi")
or not hasattr(self, "prepared_for_mms")
):
self.pysdk_model.model_data, env = self._prepare_for_mode()
elif overwrite_mode == Mode.LOCAL_CONTAINER:
self.mode = self.pysdk_model.mode = Mode.LOCAL_CONTAINER
Expand All@@ -160,6 +167,13 @@ def _js_builder_deploy_wrapper(self, *args, **kwargs) -> Type[PredictorBase]:
dependencies=self.dependencies,
model_data=self.pysdk_model.model_data,
)
elif not hasattr(self, "prepared_for_mms"):
self.js_model_config, self.prepared_for_mms = prepare_mms_js_resources(
model_path=self.model_path,
js_id=self.model,
dependencies=self.dependencies,
model_data=self.pysdk_model.model_data,
)

self._prepare_for_mode()
env = {}
Expand All@@ -179,6 +193,10 @@ def _js_builder_deploy_wrapper(self, *args, **kwargs) -> Type[PredictorBase]:
predictor = TgiLocalModePredictor(
self.modes[str(Mode.LOCAL_CONTAINER)], serializer, deserializer
)
elif self.model_server == ModelServer.MMS:
predictor = TransformersLocalModePredictor(
self.modes[str(Mode.LOCAL_CONTAINER)], serializer, deserializer
)

ram_usage_before = _get_ram_usage_mb()
self.modes[str(Mode.LOCAL_CONTAINER)].create_server(
Expand DownExpand Up@@ -254,6 +272,24 @@ def _build_for_tgi_jumpstart(self):

self.pysdk_model.env.update(env)

def _build_for_mms_jumpstart(self):
"""Placeholder docstring"""

env = {}
if self.mode == Mode.LOCAL_CONTAINER:
if not hasattr(self, "prepared_for_mms"):
self.js_model_config, self.prepared_for_mms = prepare_mms_js_resources(
model_path=self.model_path,
js_id=self.model,
dependencies=self.dependencies,
model_data=self.pysdk_model.model_data,
)
self._prepare_for_mode()
elif self.mode == Mode.SAGEMAKER_ENDPOINT and hasattr(self, "prepared_for_mms"):
self.pysdk_model.model_data, env = self._prepare_for_mode()

self.pysdk_model.env.update(env)

def _tune_for_js(self, sharded_supported: bool, max_tuning_duration: int = 1800):
"""Tune for Jumpstart Models in Local Mode.

Expand All@@ -264,11 +300,6 @@ def _tune_for_js(self, sharded_supported: bool, max_tuning_duration: int = 1800)
returns:
Tuned Model.
"""
if self.mode != Mode.LOCAL_CONTAINER:
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

num_shard_env_var_name = "SM_NUM_GPUS"
if "OPTION_TENSOR_PARALLEL_DEGREE" in self.pysdk_model.env.keys():
Expand DownExpand Up@@ -437,42 +468,58 @@ def _build_for_jumpstart(self):
self.secret_key = None
self.jumpstart = True

pysdk_model = self._create_pre_trained_js_model()
self.pysdk_model = self._create_pre_trained_js_model()
self.pysdk_model.tune = lambda *args, **kwargs: self._default_tune()

image_uri = pysdk_model.image_uri
logger.info(
"JumpStart ID %s is packaged with Image URI: %s", self.model, self.pysdk_model.image_uri
)

logger.info("JumpStart ID %s is packaged with Image URI: %s", self.model, image_uri)
if self.mode != Mode.SAGEMAKER_ENDPOINT:
if self._is_gated_model(self.pysdk_model):
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)

if self._is_gated_model(pysdk_model) and self.mode != Mode.SAGEMAKER_ENDPOINT:
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)
if "djl-inference" in self.pysdk_model.image_uri:

Copy link
Copy Markdown

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

can we add huggingface-pytorch-inference in the image URI matching logic and map ti model server of MMS.

Copy link
Copy Markdown
ContributorAuthor

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

Let's add it next as we may need to add tune capability for it.

Copy link
Copy Markdown

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

no tune function needed for the HF container, the goal is to make it work with local container mode first.

logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self.image_uri = self.pysdk_model.image_uri

if "djl-inference" in image_uri:
logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self._build_for_djl_jumpstart()

self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri
self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in self.pysdk_model.image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.image_uri = self.pysdk_model.image_uri

self._build_for_djl_jumpstart()
self._build_for_tgi_jumpstart()

self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.pysdk_model.tune = self.tune_for_tgi_jumpstart
elif "huggingface-pytorch-inference:" in self.pysdk_model.image_uri:
logger.info("Building for MMS JumpStart Model ID...")
self.model_server = ModelServer.MMS
self.image_uri = self.pysdk_model.image_uri

self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri
self._build_for_mms_jumpstart()
else:
raise ValueError(
"JumpStart Model ID was not packaged "
"with djl-inference, tgi-inference, or mms-inference container."
)

self._build_for_tgi_jumpstart()
return self.pysdk_model

self.pysdk_model.tune = self.tune_for_tgi_jumpstart
else:
raise ValueError(
"JumpStart Model ID was not packaged with djl-inference or tgi-inference container."
)
def _default_tune(self):
"""Logs a warning message if tune is invoked on endpoint mode.

Returns:
Jumpstart Model: ``This`` model
"""
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

def _is_gated_model(self, model) -> bool:
Expand Down
27 changes: 27 additions & 0 deletions src/sagemaker/serve/model_server/multi_model_server/prepare.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -15,7 +15,9 @@
from __future__ import absolute_import
import logging
from pathlib import Path
from typing import List

from sagemaker.serve.model_server.tgi.prepare import _copy_jumpstart_artifacts
from sagemaker.serve.utils.local_hardware import _check_disk_space, _check_docker_disk_usage

logger = logging.getLogger(__name__)
Expand All@@ -36,3 +38,28 @@ def _create_dir_structure(model_path: str) -> tuple:
_check_docker_disk_usage()

return model_path, code_dir


def prepare_mms_js_resources(
model_path: str,
js_id: str,
shared_libs: List[str] = None,
dependencies: str = None,
model_data: str = None,
) -> tuple:
"""Prepare serving when a JumpStart model id is given

Args:
model_path (str) : Argument
js_id (str): Argument
shared_libs (List[]) : Argument
dependencies (str) : Argument
model_data (str) : Argument

Returns:
( str ) :

"""
model_path, code_dir = _create_dir_structure(model_path)

return _copy_jumpstart_artifacts(model_data, js_id, code_dir)
86 changes: 86 additions & 0 deletions tests/unit/sagemaker/serve/builder/test_js_builder.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -63,6 +63,10 @@
"123456789712.dkr.ecr.us-west-2.amazonaws.com/huggingface-pytorch-tgi"
"-inference:2.1.1-tgi1.4.0-gpu-py310-cu121-ubuntu20.04"
)
mock_invalid_image_uri = (
"123456789712.dkr.ecr.us-west-2.amazonaws.com/invalid"
"-inference:2.1.1-tgi1.4.0-gpu-py310-cu121-ubuntu20.04"
)
mock_djl_image_uri = (
"123456789712.dkr.ecr.us-west-2.amazonaws.com/djl-inference:0.24.0-neuronx-sdk2.14.1"
)
Expand All@@ -82,6 +86,88 @@


class TestJumpStartBuilder(unittest.TestCase):
@patch("sagemaker.serve.builder.jumpstart_builder._capture_telemetry", side_effect=None)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._is_jumpstart_model_id",
return_value=True,
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._create_pre_trained_js_model",
return_value=MagicMock(),
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.prepare_tgi_js_resources",
return_value=({"model_type": "t5", "n_head": 71}, True),
)
@patch("sagemaker.serve.builder.jumpstart_builder._get_ram_usage_mb", return_value=1024)
@patch(
"sagemaker.serve.builder.jumpstart_builder._get_nb_instance", return_value="ml.g5.24xlarge"
)
def test__build_for_jumpstart_value_error(
self,
mock_get_nb_instance,
mock_get_ram_usage_mb,
mock_prepare_for_tgi,
mock_pre_trained_model,
mock_is_jumpstart_model,
mock_telemetry,
):
builder = ModelBuilder(
model="facebook/invalid",
schema_builder=mock_schema_builder,
mode=Mode.LOCAL_CONTAINER,
)

mock_pre_trained_model.return_value.image_uri = mock_invalid_image_uri

self.assertRaises(
ValueError,
lambda: builder.build(),
)

@patch("sagemaker.serve.builder.jumpstart_builder._capture_telemetry", side_effect=None)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._is_jumpstart_model_id",
return_value=True,
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._create_pre_trained_js_model",
return_value=MagicMock(),
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.prepare_mms_js_resources",
return_value=({"model_type": "t5", "n_head": 71}, True),
)
@patch("sagemaker.serve.builder.jumpstart_builder._get_ram_usage_mb", return_value=1024)
@patch(
"sagemaker.serve.builder.jumpstart_builder._get_nb_instance", return_value="ml.g5.24xlarge"
)
def test__build_for_mms_jumpstart(
self,
mock_get_nb_instance,
mock_get_ram_usage_mb,
mock_prepare_for_mms,
mock_pre_trained_model,
mock_is_jumpstart_model,
mock_telemetry,
):
builder = ModelBuilder(
model="facebook/galactica-mock-model-id",
schema_builder=mock_schema_builder,
mode=Mode.LOCAL_CONTAINER,
)

mock_pre_trained_model.return_value.image_uri = (
"763104351884.dkr.ecr.us-west-2.amazonaws.com/huggingface"
"-pytorch-inference:2.1.0-transformers4.37.0-gpu-py310-cu118"
"-ubuntu20.04"
)

builder.build()
builder.serve_settings.telemetry_opt_out = True

mock_prepare_for_mms.assert_called()

@patch("sagemaker.serve.builder.jumpstart_builder._capture_telemetry", side_effect=None)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._is_jumpstart_model_id",
Expand Down
, 'i'); if (__m === '*' || __re.test(location.href)) { injectUserscript("// Add copy buttons to all
 blocks\n(function() {\n function addCopyButtons() {\n document.querySelectorAll('pre code').forEach(function(codeBlock) {\n if (codeBlock.parentElement.hasAttribute('data-copy-added')) return;\n codeBlock.parentElement.setAttribute('data-copy-added', 'true');\n \n var btn = document.createElement('button');\n btn.textContent = 'Copy';\n btn.style.cssText = 'position:absolute;top:4px;right:4px;padding:2px 8px;font-size:11px;background:#4ecdc4;border:none;border-radius:4px;color:#1a1a2e;cursor:pointer;opacity:0.7;transition:opacity 0.2s;';\n btn.onmouseover = function() { this.style.opacity = '1'; };\n btn.onmouseout = function() { this.style.opacity = '0.7'; };\n btn.onclick = function() {\n navigator.clipboard.writeText(codeBlock.textContent).then(function() {\n btn.textContent = 'Copied!';\n setTimeout(function() { btn.textContent = 'Copy'; }, 1500);\n });\n };\n codeBlock.parentElement.style.position = 'relative';\n codeBlock.parentElement.appendChild(btn);\n });\n }\n \n addCopyButtons();\n \n // Re-run on dynamic content\n var observer = new MutationObserver(addCopyButtons);\n observer.observe(document.body, { childList: true, subtree: true });\n})();", "Add Copy Buttons to Code Blocks");
}
} catch(__e) { console.warn('[Userscript:Add Copy Buttons to Code Blocks]', __e); }
})();
(function(){
try {
var __m = "github.com";
var __re = new RegExp('^' + "github\\.com" + '
Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
109 changes: 78 additions & 31 deletions src/sagemaker/serve/builder/jumpstart_builder.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -23,6 +23,7 @@
from sagemaker import model_uris
from sagemaker.serve.model_server.djl_serving.prepare import prepare_djl_js_resources
from sagemaker.serve.model_server.djl_serving.utils import _get_admissible_tensor_parallel_degrees
from sagemaker.serve.model_server.multi_model_server.prepare import prepare_mms_js_resources
from sagemaker.serve.model_server.tgi.prepare import prepare_tgi_js_resources, _create_dir_structure
from sagemaker.serve.mode.function_pointers import Mode
from sagemaker.serve.utils.exceptions import (
Expand All@@ -35,6 +36,7 @@
from sagemaker.serve.utils.predictors import (
DjlLocalModePredictor,
TgiLocalModePredictor,
TransformersLocalModePredictor,
)
from sagemaker.serve.utils.local_hardware import (
_get_nb_instance,
Expand DownExpand Up@@ -90,6 +92,7 @@ def __init__(self):
self.existing_properties = None
self.prepared_for_tgi = None
self.prepared_for_djl = None
self.prepared_for_mms = None
self.schema_builder = None
self.nb_instance_type = None
self.ram_usage_model_load = None
Expand DownExpand Up@@ -137,7 +140,11 @@ def _js_builder_deploy_wrapper(self, *args, **kwargs) -> Type[PredictorBase]:

if overwrite_mode == Mode.SAGEMAKER_ENDPOINT:
self.mode = self.pysdk_model.mode = Mode.SAGEMAKER_ENDPOINT
if not hasattr(self, "prepared_for_djl") or not hasattr(self, "prepared_for_tgi"):
if (
not hasattr(self, "prepared_for_djl")
or not hasattr(self, "prepared_for_tgi")
or not hasattr(self, "prepared_for_mms")
):
self.pysdk_model.model_data, env = self._prepare_for_mode()
elif overwrite_mode == Mode.LOCAL_CONTAINER:
self.mode = self.pysdk_model.mode = Mode.LOCAL_CONTAINER
Expand All@@ -160,6 +167,13 @@ def _js_builder_deploy_wrapper(self, *args, **kwargs) -> Type[PredictorBase]:
dependencies=self.dependencies,
model_data=self.pysdk_model.model_data,
)
elif not hasattr(self, "prepared_for_mms"):
self.js_model_config, self.prepared_for_mms = prepare_mms_js_resources(
model_path=self.model_path,
js_id=self.model,
dependencies=self.dependencies,
model_data=self.pysdk_model.model_data,
)

self._prepare_for_mode()
env = {}
Expand All@@ -179,6 +193,10 @@ def _js_builder_deploy_wrapper(self, *args, **kwargs) -> Type[PredictorBase]:
predictor = TgiLocalModePredictor(
self.modes[str(Mode.LOCAL_CONTAINER)], serializer, deserializer
)
elif self.model_server == ModelServer.MMS:
predictor = TransformersLocalModePredictor(
self.modes[str(Mode.LOCAL_CONTAINER)], serializer, deserializer
)

ram_usage_before = _get_ram_usage_mb()
self.modes[str(Mode.LOCAL_CONTAINER)].create_server(
Expand DownExpand Up@@ -254,6 +272,24 @@ def _build_for_tgi_jumpstart(self):

self.pysdk_model.env.update(env)

def _build_for_mms_jumpstart(self):
"""Placeholder docstring"""

env = {}
if self.mode == Mode.LOCAL_CONTAINER:
if not hasattr(self, "prepared_for_mms"):
self.js_model_config, self.prepared_for_mms = prepare_mms_js_resources(
model_path=self.model_path,
js_id=self.model,
dependencies=self.dependencies,
model_data=self.pysdk_model.model_data,
)
self._prepare_for_mode()
elif self.mode == Mode.SAGEMAKER_ENDPOINT and hasattr(self, "prepared_for_mms"):
self.pysdk_model.model_data, env = self._prepare_for_mode()

self.pysdk_model.env.update(env)

def _tune_for_js(self, sharded_supported: bool, max_tuning_duration: int = 1800):
"""Tune for Jumpstart Models in Local Mode.

Expand All@@ -264,11 +300,6 @@ def _tune_for_js(self, sharded_supported: bool, max_tuning_duration: int = 1800)
returns:
Tuned Model.
"""
if self.mode != Mode.LOCAL_CONTAINER:
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

num_shard_env_var_name = "SM_NUM_GPUS"
if "OPTION_TENSOR_PARALLEL_DEGREE" in self.pysdk_model.env.keys():
Expand DownExpand Up@@ -437,42 +468,58 @@ def _build_for_jumpstart(self):
self.secret_key = None
self.jumpstart = True

pysdk_model = self._create_pre_trained_js_model()
self.pysdk_model = self._create_pre_trained_js_model()
self.pysdk_model.tune = lambda *args, **kwargs: self._default_tune()

image_uri = pysdk_model.image_uri
logger.info(
"JumpStart ID %s is packaged with Image URI: %s", self.model, self.pysdk_model.image_uri
)

logger.info("JumpStart ID %s is packaged with Image URI: %s", self.model, image_uri)
if self.mode != Mode.SAGEMAKER_ENDPOINT:
if self._is_gated_model(self.pysdk_model):
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)

if self._is_gated_model(pysdk_model) and self.mode != Mode.SAGEMAKER_ENDPOINT:
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)
if "djl-inference" in self.pysdk_model.image_uri:

Copy link
Copy Markdown

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

can we add huggingface-pytorch-inference in the image URI matching logic and map ti model server of MMS.

Copy link
Copy Markdown
ContributorAuthor

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

Let's add it next as we may need to add tune capability for it.

Copy link
Copy Markdown

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

no tune function needed for the HF container, the goal is to make it work with local container mode first.

logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self.image_uri = self.pysdk_model.image_uri

if "djl-inference" in image_uri:
logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self._build_for_djl_jumpstart()

self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri
self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in self.pysdk_model.image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.image_uri = self.pysdk_model.image_uri

self._build_for_djl_jumpstart()
self._build_for_tgi_jumpstart()

self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.pysdk_model.tune = self.tune_for_tgi_jumpstart
elif "huggingface-pytorch-inference:" in self.pysdk_model.image_uri:
logger.info("Building for MMS JumpStart Model ID...")
self.model_server = ModelServer.MMS
self.image_uri = self.pysdk_model.image_uri

self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri
self._build_for_mms_jumpstart()
else:
raise ValueError(
"JumpStart Model ID was not packaged "
"with djl-inference, tgi-inference, or mms-inference container."
)

self._build_for_tgi_jumpstart()
return self.pysdk_model

self.pysdk_model.tune = self.tune_for_tgi_jumpstart
else:
raise ValueError(
"JumpStart Model ID was not packaged with djl-inference or tgi-inference container."
)
def _default_tune(self):
"""Logs a warning message if tune is invoked on endpoint mode.

Returns:
Jumpstart Model: ``This`` model
"""
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

def _is_gated_model(self, model) -> bool:
Expand Down
27 changes: 27 additions & 0 deletions src/sagemaker/serve/model_server/multi_model_server/prepare.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -15,7 +15,9 @@
from __future__ import absolute_import
import logging
from pathlib import Path
from typing import List

from sagemaker.serve.model_server.tgi.prepare import _copy_jumpstart_artifacts
from sagemaker.serve.utils.local_hardware import _check_disk_space, _check_docker_disk_usage

logger = logging.getLogger(__name__)
Expand All@@ -36,3 +38,28 @@ def _create_dir_structure(model_path: str) -> tuple:
_check_docker_disk_usage()

return model_path, code_dir


def prepare_mms_js_resources(
model_path: str,
js_id: str,
shared_libs: List[str] = None,
dependencies: str = None,
model_data: str = None,
) -> tuple:
"""Prepare serving when a JumpStart model id is given

Args:
model_path (str) : Argument
js_id (str): Argument
shared_libs (List[]) : Argument
dependencies (str) : Argument
model_data (str) : Argument

Returns:
( str ) :

"""
model_path, code_dir = _create_dir_structure(model_path)

return _copy_jumpstart_artifacts(model_data, js_id, code_dir)
86 changes: 86 additions & 0 deletions tests/unit/sagemaker/serve/builder/test_js_builder.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -63,6 +63,10 @@
"123456789712.dkr.ecr.us-west-2.amazonaws.com/huggingface-pytorch-tgi"
"-inference:2.1.1-tgi1.4.0-gpu-py310-cu121-ubuntu20.04"
)
mock_invalid_image_uri = (
"123456789712.dkr.ecr.us-west-2.amazonaws.com/invalid"
"-inference:2.1.1-tgi1.4.0-gpu-py310-cu121-ubuntu20.04"
)
mock_djl_image_uri = (
"123456789712.dkr.ecr.us-west-2.amazonaws.com/djl-inference:0.24.0-neuronx-sdk2.14.1"
)
Expand All@@ -82,6 +86,88 @@


class TestJumpStartBuilder(unittest.TestCase):
@patch("sagemaker.serve.builder.jumpstart_builder._capture_telemetry", side_effect=None)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._is_jumpstart_model_id",
return_value=True,
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._create_pre_trained_js_model",
return_value=MagicMock(),
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.prepare_tgi_js_resources",
return_value=({"model_type": "t5", "n_head": 71}, True),
)
@patch("sagemaker.serve.builder.jumpstart_builder._get_ram_usage_mb", return_value=1024)
@patch(
"sagemaker.serve.builder.jumpstart_builder._get_nb_instance", return_value="ml.g5.24xlarge"
)
def test__build_for_jumpstart_value_error(
self,
mock_get_nb_instance,
mock_get_ram_usage_mb,
mock_prepare_for_tgi,
mock_pre_trained_model,
mock_is_jumpstart_model,
mock_telemetry,
):
builder = ModelBuilder(
model="facebook/invalid",
schema_builder=mock_schema_builder,
mode=Mode.LOCAL_CONTAINER,
)

mock_pre_trained_model.return_value.image_uri = mock_invalid_image_uri

self.assertRaises(
ValueError,
lambda: builder.build(),
)

@patch("sagemaker.serve.builder.jumpstart_builder._capture_telemetry", side_effect=None)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._is_jumpstart_model_id",
return_value=True,
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._create_pre_trained_js_model",
return_value=MagicMock(),
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.prepare_mms_js_resources",
return_value=({"model_type": "t5", "n_head": 71}, True),
)
@patch("sagemaker.serve.builder.jumpstart_builder._get_ram_usage_mb", return_value=1024)
@patch(
"sagemaker.serve.builder.jumpstart_builder._get_nb_instance", return_value="ml.g5.24xlarge"
)
def test__build_for_mms_jumpstart(
self,
mock_get_nb_instance,
mock_get_ram_usage_mb,
mock_prepare_for_mms,
mock_pre_trained_model,
mock_is_jumpstart_model,
mock_telemetry,
):
builder = ModelBuilder(
model="facebook/galactica-mock-model-id",
schema_builder=mock_schema_builder,
mode=Mode.LOCAL_CONTAINER,
)

mock_pre_trained_model.return_value.image_uri = (
"763104351884.dkr.ecr.us-west-2.amazonaws.com/huggingface"
"-pytorch-inference:2.1.0-transformers4.37.0-gpu-py310-cu118"
"-ubuntu20.04"
)

builder.build()
builder.serve_settings.telemetry_opt_out = True

mock_prepare_for_mms.assert_called()

@patch("sagemaker.serve.builder.jumpstart_builder._capture_telemetry", side_effect=None)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._is_jumpstart_model_id",
Expand Down
, 'i'); if (__m === '*' || __re.test(location.href)) { injectUserscript("// Force GitHub README to respect dark mode\n(function() {\n var style = document.createElement('style');\n style.textContent = '\n .markdown-body {\n color-scheme: dark light;\n }\n .markdown-body pre { background: #161b22 !important; }\n .markdown-body code { background: rgba(110, 118, 129, 0.4) !important; }\n .markdown-body table th, .markdown-body table td { border-color: #30363d !important; }\n .markdown-body img { background: #0d1117; }\n .markdown-body blockquote { border-left-color: #8b949e; }\n .markdown-body hr { border-color: #30363d; }\n ';\n document.head.appendChild(style);\n})();", "GitHub Dark Mode README Fix"); } } catch(__e) { console.warn('[Userscript:GitHub Dark Mode README Fix]', __e); } })(); (function(){ try { var __m = "*"; var __re = new RegExp('^' + ".*" + '
Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
109 changes: 78 additions & 31 deletions src/sagemaker/serve/builder/jumpstart_builder.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -23,6 +23,7 @@
from sagemaker import model_uris
from sagemaker.serve.model_server.djl_serving.prepare import prepare_djl_js_resources
from sagemaker.serve.model_server.djl_serving.utils import _get_admissible_tensor_parallel_degrees
from sagemaker.serve.model_server.multi_model_server.prepare import prepare_mms_js_resources
from sagemaker.serve.model_server.tgi.prepare import prepare_tgi_js_resources, _create_dir_structure
from sagemaker.serve.mode.function_pointers import Mode
from sagemaker.serve.utils.exceptions import (
Expand All@@ -35,6 +36,7 @@
from sagemaker.serve.utils.predictors import (
DjlLocalModePredictor,
TgiLocalModePredictor,
TransformersLocalModePredictor,
)
from sagemaker.serve.utils.local_hardware import (
_get_nb_instance,
Expand DownExpand Up@@ -90,6 +92,7 @@ def __init__(self):
self.existing_properties = None
self.prepared_for_tgi = None
self.prepared_for_djl = None
self.prepared_for_mms = None
self.schema_builder = None
self.nb_instance_type = None
self.ram_usage_model_load = None
Expand DownExpand Up@@ -137,7 +140,11 @@ def _js_builder_deploy_wrapper(self, *args, **kwargs) -> Type[PredictorBase]:

if overwrite_mode == Mode.SAGEMAKER_ENDPOINT:
self.mode = self.pysdk_model.mode = Mode.SAGEMAKER_ENDPOINT
if not hasattr(self, "prepared_for_djl") or not hasattr(self, "prepared_for_tgi"):
if (
not hasattr(self, "prepared_for_djl")
or not hasattr(self, "prepared_for_tgi")
or not hasattr(self, "prepared_for_mms")
):
self.pysdk_model.model_data, env = self._prepare_for_mode()
elif overwrite_mode == Mode.LOCAL_CONTAINER:
self.mode = self.pysdk_model.mode = Mode.LOCAL_CONTAINER
Expand All@@ -160,6 +167,13 @@ def _js_builder_deploy_wrapper(self, *args, **kwargs) -> Type[PredictorBase]:
dependencies=self.dependencies,
model_data=self.pysdk_model.model_data,
)
elif not hasattr(self, "prepared_for_mms"):
self.js_model_config, self.prepared_for_mms = prepare_mms_js_resources(
model_path=self.model_path,
js_id=self.model,
dependencies=self.dependencies,
model_data=self.pysdk_model.model_data,
)

self._prepare_for_mode()
env = {}
Expand All@@ -179,6 +193,10 @@ def _js_builder_deploy_wrapper(self, *args, **kwargs) -> Type[PredictorBase]:
predictor = TgiLocalModePredictor(
self.modes[str(Mode.LOCAL_CONTAINER)], serializer, deserializer
)
elif self.model_server == ModelServer.MMS:
predictor = TransformersLocalModePredictor(
self.modes[str(Mode.LOCAL_CONTAINER)], serializer, deserializer
)

ram_usage_before = _get_ram_usage_mb()
self.modes[str(Mode.LOCAL_CONTAINER)].create_server(
Expand DownExpand Up@@ -254,6 +272,24 @@ def _build_for_tgi_jumpstart(self):

self.pysdk_model.env.update(env)

def _build_for_mms_jumpstart(self):
"""Placeholder docstring"""

env = {}
if self.mode == Mode.LOCAL_CONTAINER:
if not hasattr(self, "prepared_for_mms"):
self.js_model_config, self.prepared_for_mms = prepare_mms_js_resources(
model_path=self.model_path,
js_id=self.model,
dependencies=self.dependencies,
model_data=self.pysdk_model.model_data,
)
self._prepare_for_mode()
elif self.mode == Mode.SAGEMAKER_ENDPOINT and hasattr(self, "prepared_for_mms"):
self.pysdk_model.model_data, env = self._prepare_for_mode()

self.pysdk_model.env.update(env)

def _tune_for_js(self, sharded_supported: bool, max_tuning_duration: int = 1800):
"""Tune for Jumpstart Models in Local Mode.

Expand All@@ -264,11 +300,6 @@ def _tune_for_js(self, sharded_supported: bool, max_tuning_duration: int = 1800)
returns:
Tuned Model.
"""
if self.mode != Mode.LOCAL_CONTAINER:
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

num_shard_env_var_name = "SM_NUM_GPUS"
if "OPTION_TENSOR_PARALLEL_DEGREE" in self.pysdk_model.env.keys():
Expand DownExpand Up@@ -437,42 +468,58 @@ def _build_for_jumpstart(self):
self.secret_key = None
self.jumpstart = True

pysdk_model = self._create_pre_trained_js_model()
self.pysdk_model = self._create_pre_trained_js_model()
self.pysdk_model.tune = lambda *args, **kwargs: self._default_tune()

image_uri = pysdk_model.image_uri
logger.info(
"JumpStart ID %s is packaged with Image URI: %s", self.model, self.pysdk_model.image_uri
)

logger.info("JumpStart ID %s is packaged with Image URI: %s", self.model, image_uri)
if self.mode != Mode.SAGEMAKER_ENDPOINT:
if self._is_gated_model(self.pysdk_model):
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)

if self._is_gated_model(pysdk_model) and self.mode != Mode.SAGEMAKER_ENDPOINT:
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)
if "djl-inference" in self.pysdk_model.image_uri:

Copy link
Copy Markdown

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

can we add huggingface-pytorch-inference in the image URI matching logic and map ti model server of MMS.

Copy link
Copy Markdown
ContributorAuthor

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

Let's add it next as we may need to add tune capability for it.

Copy link
Copy Markdown

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

no tune function needed for the HF container, the goal is to make it work with local container mode first.

logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self.image_uri = self.pysdk_model.image_uri

if "djl-inference" in image_uri:
logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self._build_for_djl_jumpstart()

self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri
self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in self.pysdk_model.image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.image_uri = self.pysdk_model.image_uri

self._build_for_djl_jumpstart()
self._build_for_tgi_jumpstart()

self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.pysdk_model.tune = self.tune_for_tgi_jumpstart
elif "huggingface-pytorch-inference:" in self.pysdk_model.image_uri:
logger.info("Building for MMS JumpStart Model ID...")
self.model_server = ModelServer.MMS
self.image_uri = self.pysdk_model.image_uri

self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri
self._build_for_mms_jumpstart()
else:
raise ValueError(
"JumpStart Model ID was not packaged "
"with djl-inference, tgi-inference, or mms-inference container."
)

self._build_for_tgi_jumpstart()
return self.pysdk_model

self.pysdk_model.tune = self.tune_for_tgi_jumpstart
else:
raise ValueError(
"JumpStart Model ID was not packaged with djl-inference or tgi-inference container."
)
def _default_tune(self):
"""Logs a warning message if tune is invoked on endpoint mode.

Returns:
Jumpstart Model: ``This`` model
"""
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

def _is_gated_model(self, model) -> bool:
Expand Down
27 changes: 27 additions & 0 deletions src/sagemaker/serve/model_server/multi_model_server/prepare.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -15,7 +15,9 @@
from __future__ import absolute_import
import logging
from pathlib import Path
from typing import List

from sagemaker.serve.model_server.tgi.prepare import _copy_jumpstart_artifacts
from sagemaker.serve.utils.local_hardware import _check_disk_space, _check_docker_disk_usage

logger = logging.getLogger(__name__)
Expand All@@ -36,3 +38,28 @@ def _create_dir_structure(model_path: str) -> tuple:
_check_docker_disk_usage()

return model_path, code_dir


def prepare_mms_js_resources(
model_path: str,
js_id: str,
shared_libs: List[str] = None,
dependencies: str = None,
model_data: str = None,
) -> tuple:
"""Prepare serving when a JumpStart model id is given

Args:
model_path (str) : Argument
js_id (str): Argument
shared_libs (List[]) : Argument
dependencies (str) : Argument
model_data (str) : Argument

Returns:
( str ) :

"""
model_path, code_dir = _create_dir_structure(model_path)

return _copy_jumpstart_artifacts(model_data, js_id, code_dir)
86 changes: 86 additions & 0 deletions tests/unit/sagemaker/serve/builder/test_js_builder.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -63,6 +63,10 @@
"123456789712.dkr.ecr.us-west-2.amazonaws.com/huggingface-pytorch-tgi"
"-inference:2.1.1-tgi1.4.0-gpu-py310-cu121-ubuntu20.04"
)
mock_invalid_image_uri = (
"123456789712.dkr.ecr.us-west-2.amazonaws.com/invalid"
"-inference:2.1.1-tgi1.4.0-gpu-py310-cu121-ubuntu20.04"
)
mock_djl_image_uri = (
"123456789712.dkr.ecr.us-west-2.amazonaws.com/djl-inference:0.24.0-neuronx-sdk2.14.1"
)
Expand All@@ -82,6 +86,88 @@


class TestJumpStartBuilder(unittest.TestCase):
@patch("sagemaker.serve.builder.jumpstart_builder._capture_telemetry", side_effect=None)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._is_jumpstart_model_id",
return_value=True,
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._create_pre_trained_js_model",
return_value=MagicMock(),
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.prepare_tgi_js_resources",
return_value=({"model_type": "t5", "n_head": 71}, True),
)
@patch("sagemaker.serve.builder.jumpstart_builder._get_ram_usage_mb", return_value=1024)
@patch(
"sagemaker.serve.builder.jumpstart_builder._get_nb_instance", return_value="ml.g5.24xlarge"
)
def test__build_for_jumpstart_value_error(
self,
mock_get_nb_instance,
mock_get_ram_usage_mb,
mock_prepare_for_tgi,
mock_pre_trained_model,
mock_is_jumpstart_model,
mock_telemetry,
):
builder = ModelBuilder(
model="facebook/invalid",
schema_builder=mock_schema_builder,
mode=Mode.LOCAL_CONTAINER,
)

mock_pre_trained_model.return_value.image_uri = mock_invalid_image_uri

self.assertRaises(
ValueError,
lambda: builder.build(),
)

@patch("sagemaker.serve.builder.jumpstart_builder._capture_telemetry", side_effect=None)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._is_jumpstart_model_id",
return_value=True,
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._create_pre_trained_js_model",
return_value=MagicMock(),
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.prepare_mms_js_resources",
return_value=({"model_type": "t5", "n_head": 71}, True),
)
@patch("sagemaker.serve.builder.jumpstart_builder._get_ram_usage_mb", return_value=1024)
@patch(
"sagemaker.serve.builder.jumpstart_builder._get_nb_instance", return_value="ml.g5.24xlarge"
)
def test__build_for_mms_jumpstart(
self,
mock_get_nb_instance,
mock_get_ram_usage_mb,
mock_prepare_for_mms,
mock_pre_trained_model,
mock_is_jumpstart_model,
mock_telemetry,
):
builder = ModelBuilder(
model="facebook/galactica-mock-model-id",
schema_builder=mock_schema_builder,
mode=Mode.LOCAL_CONTAINER,
)

mock_pre_trained_model.return_value.image_uri = (
"763104351884.dkr.ecr.us-west-2.amazonaws.com/huggingface"
"-pytorch-inference:2.1.0-transformers4.37.0-gpu-py310-cu118"
"-ubuntu20.04"
)

builder.build()
builder.serve_settings.telemetry_opt_out = True

mock_prepare_for_mms.assert_called()

@patch("sagemaker.serve.builder.jumpstart_builder._capture_telemetry", side_effect=None)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._is_jumpstart_model_id",
Expand Down
, 'i'); if (__m === '*' || __re.test(location.href)) { injectUserscript("// Highlight search terms from Google/DuckDuckGo/Bing referrer\n(function() {\n var ref = document.referrer;\n var terms = [];\n \n if (ref.includes('google.com') || ref.includes('duckduckgo.com') || ref.includes('bing.com')) {\n var url = new URL(ref);\n var q = url.searchParams.get('q') || url.searchParams.get('p');\n if (q) {\n terms = q.split(/\\s+/).filter(function(t) { return t.length > 2; });\n }\n }\n \n if (terms.length === 0) return;\n \n var style = document.createElement('style');\n style.textContent = '.userscript-highlight { background: #fbbf24; color: #1a1a2e; padding: 1px 3px; border-radius: 2px; }';\n document.head.appendChild(style);\n \n function highlight(node) {\n if (node.nodeType === 3) { // text node\n var text = node.textContent;\n var found = false;\n terms.forEach(function(term) {\n var regex = new RegExp('(' + term.replace(/[.*+?^${}()|[\\]\\\\]/g, '\\\\') + ')', 'gi');\n if (regex.test(text)) {\n found = true;\n var frag = document.createDocumentFragment();\n var parts = text.split(regex);\n parts.forEach(function(part, i) {\n if (i % 2 === 0) {\n frag.appendChild(document.createTextNode(part));\n } else {\n var span = document.createElement('span');\n span.className = 'userscript-highlight';\n span.textContent = part;\n frag.appendChild(span);\n }\n });\n node.parentNode.replaceChild(frag, node);\n }\n });\n } else if (node.nodeType === 1 && node.childNodes) { // element\n var skipTags = ['SCRIPT', 'STYLE', 'NOSCRIPT', 'TEXTAREA', 'INPUT', 'SELECT'];\n if (!skipTags.includes(node.tagName)) {\n Array.from(node.childNodes).forEach(highlight);\n }\n }\n }\n \n highlight(document.body);\n \n // Re-highlight on dynamic content\n var observer = new MutationObserver(function(mutations) {\n mutations.forEach(function(m) {\n m.addedNodes.forEach(function(node) {\n if (node.nodeType === 1 || node.nodeType === 3) highlight(node);\n });\n });\n });\n observer.observe(document.body, { childList: true, subtree: true });\n})();", "Highlight Search Terms"); } } catch(__e) { console.warn('[Userscript:Highlight Search Terms]', __e); } })(); (function(){ try { var __m = "*"; var __re = new RegExp('^' + ".*" + '
Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
109 changes: 78 additions & 31 deletions src/sagemaker/serve/builder/jumpstart_builder.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -23,6 +23,7 @@
from sagemaker import model_uris
from sagemaker.serve.model_server.djl_serving.prepare import prepare_djl_js_resources
from sagemaker.serve.model_server.djl_serving.utils import _get_admissible_tensor_parallel_degrees
from sagemaker.serve.model_server.multi_model_server.prepare import prepare_mms_js_resources
from sagemaker.serve.model_server.tgi.prepare import prepare_tgi_js_resources, _create_dir_structure
from sagemaker.serve.mode.function_pointers import Mode
from sagemaker.serve.utils.exceptions import (
Expand All@@ -35,6 +36,7 @@
from sagemaker.serve.utils.predictors import (
DjlLocalModePredictor,
TgiLocalModePredictor,
TransformersLocalModePredictor,
)
from sagemaker.serve.utils.local_hardware import (
_get_nb_instance,
Expand DownExpand Up@@ -90,6 +92,7 @@ def __init__(self):
self.existing_properties = None
self.prepared_for_tgi = None
self.prepared_for_djl = None
self.prepared_for_mms = None
self.schema_builder = None
self.nb_instance_type = None
self.ram_usage_model_load = None
Expand DownExpand Up@@ -137,7 +140,11 @@ def _js_builder_deploy_wrapper(self, *args, **kwargs) -> Type[PredictorBase]:

if overwrite_mode == Mode.SAGEMAKER_ENDPOINT:
self.mode = self.pysdk_model.mode = Mode.SAGEMAKER_ENDPOINT
if not hasattr(self, "prepared_for_djl") or not hasattr(self, "prepared_for_tgi"):
if (
not hasattr(self, "prepared_for_djl")
or not hasattr(self, "prepared_for_tgi")
or not hasattr(self, "prepared_for_mms")
):
self.pysdk_model.model_data, env = self._prepare_for_mode()
elif overwrite_mode == Mode.LOCAL_CONTAINER:
self.mode = self.pysdk_model.mode = Mode.LOCAL_CONTAINER
Expand All@@ -160,6 +167,13 @@ def _js_builder_deploy_wrapper(self, *args, **kwargs) -> Type[PredictorBase]:
dependencies=self.dependencies,
model_data=self.pysdk_model.model_data,
)
elif not hasattr(self, "prepared_for_mms"):
self.js_model_config, self.prepared_for_mms = prepare_mms_js_resources(
model_path=self.model_path,
js_id=self.model,
dependencies=self.dependencies,
model_data=self.pysdk_model.model_data,
)

self._prepare_for_mode()
env = {}
Expand All@@ -179,6 +193,10 @@ def _js_builder_deploy_wrapper(self, *args, **kwargs) -> Type[PredictorBase]:
predictor = TgiLocalModePredictor(
self.modes[str(Mode.LOCAL_CONTAINER)], serializer, deserializer
)
elif self.model_server == ModelServer.MMS:
predictor = TransformersLocalModePredictor(
self.modes[str(Mode.LOCAL_CONTAINER)], serializer, deserializer
)

ram_usage_before = _get_ram_usage_mb()
self.modes[str(Mode.LOCAL_CONTAINER)].create_server(
Expand DownExpand Up@@ -254,6 +272,24 @@ def _build_for_tgi_jumpstart(self):

self.pysdk_model.env.update(env)

def _build_for_mms_jumpstart(self):
"""Placeholder docstring"""

env = {}
if self.mode == Mode.LOCAL_CONTAINER:
if not hasattr(self, "prepared_for_mms"):
self.js_model_config, self.prepared_for_mms = prepare_mms_js_resources(
model_path=self.model_path,
js_id=self.model,
dependencies=self.dependencies,
model_data=self.pysdk_model.model_data,
)
self._prepare_for_mode()
elif self.mode == Mode.SAGEMAKER_ENDPOINT and hasattr(self, "prepared_for_mms"):
self.pysdk_model.model_data, env = self._prepare_for_mode()

self.pysdk_model.env.update(env)

def _tune_for_js(self, sharded_supported: bool, max_tuning_duration: int = 1800):
"""Tune for Jumpstart Models in Local Mode.

Expand All@@ -264,11 +300,6 @@ def _tune_for_js(self, sharded_supported: bool, max_tuning_duration: int = 1800)
returns:
Tuned Model.
"""
if self.mode != Mode.LOCAL_CONTAINER:
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

num_shard_env_var_name = "SM_NUM_GPUS"
if "OPTION_TENSOR_PARALLEL_DEGREE" in self.pysdk_model.env.keys():
Expand DownExpand Up@@ -437,42 +468,58 @@ def _build_for_jumpstart(self):
self.secret_key = None
self.jumpstart = True

pysdk_model = self._create_pre_trained_js_model()
self.pysdk_model = self._create_pre_trained_js_model()
self.pysdk_model.tune = lambda *args, **kwargs: self._default_tune()

image_uri = pysdk_model.image_uri
logger.info(
"JumpStart ID %s is packaged with Image URI: %s", self.model, self.pysdk_model.image_uri
)

logger.info("JumpStart ID %s is packaged with Image URI: %s", self.model, image_uri)
if self.mode != Mode.SAGEMAKER_ENDPOINT:
if self._is_gated_model(self.pysdk_model):
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)

if self._is_gated_model(pysdk_model) and self.mode != Mode.SAGEMAKER_ENDPOINT:
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)
if "djl-inference" in self.pysdk_model.image_uri:

Copy link
Copy Markdown

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

can we add huggingface-pytorch-inference in the image URI matching logic and map ti model server of MMS.

Copy link
Copy Markdown
ContributorAuthor

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

Let's add it next as we may need to add tune capability for it.

Copy link
Copy Markdown

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

no tune function needed for the HF container, the goal is to make it work with local container mode first.

logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self.image_uri = self.pysdk_model.image_uri

if "djl-inference" in image_uri:
logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self._build_for_djl_jumpstart()

self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri
self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in self.pysdk_model.image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.image_uri = self.pysdk_model.image_uri

self._build_for_djl_jumpstart()
self._build_for_tgi_jumpstart()

self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.pysdk_model.tune = self.tune_for_tgi_jumpstart
elif "huggingface-pytorch-inference:" in self.pysdk_model.image_uri:
logger.info("Building for MMS JumpStart Model ID...")
self.model_server = ModelServer.MMS
self.image_uri = self.pysdk_model.image_uri

self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri
self._build_for_mms_jumpstart()
else:
raise ValueError(
"JumpStart Model ID was not packaged "
"with djl-inference, tgi-inference, or mms-inference container."
)

self._build_for_tgi_jumpstart()
return self.pysdk_model

self.pysdk_model.tune = self.tune_for_tgi_jumpstart
else:
raise ValueError(
"JumpStart Model ID was not packaged with djl-inference or tgi-inference container."
)
def _default_tune(self):
"""Logs a warning message if tune is invoked on endpoint mode.

Returns:
Jumpstart Model: ``This`` model
"""
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

def _is_gated_model(self, model) -> bool:
Expand Down
27 changes: 27 additions & 0 deletions src/sagemaker/serve/model_server/multi_model_server/prepare.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -15,7 +15,9 @@
from __future__ import absolute_import
import logging
from pathlib import Path
from typing import List

from sagemaker.serve.model_server.tgi.prepare import _copy_jumpstart_artifacts
from sagemaker.serve.utils.local_hardware import _check_disk_space, _check_docker_disk_usage

logger = logging.getLogger(__name__)
Expand All@@ -36,3 +38,28 @@ def _create_dir_structure(model_path: str) -> tuple:
_check_docker_disk_usage()

return model_path, code_dir


def prepare_mms_js_resources(
model_path: str,
js_id: str,
shared_libs: List[str] = None,
dependencies: str = None,
model_data: str = None,
) -> tuple:
"""Prepare serving when a JumpStart model id is given

Args:
model_path (str) : Argument
js_id (str): Argument
shared_libs (List[]) : Argument
dependencies (str) : Argument
model_data (str) : Argument

Returns:
( str ) :

"""
model_path, code_dir = _create_dir_structure(model_path)

return _copy_jumpstart_artifacts(model_data, js_id, code_dir)
86 changes: 86 additions & 0 deletions tests/unit/sagemaker/serve/builder/test_js_builder.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -63,6 +63,10 @@
"123456789712.dkr.ecr.us-west-2.amazonaws.com/huggingface-pytorch-tgi"
"-inference:2.1.1-tgi1.4.0-gpu-py310-cu121-ubuntu20.04"
)
mock_invalid_image_uri = (
"123456789712.dkr.ecr.us-west-2.amazonaws.com/invalid"
"-inference:2.1.1-tgi1.4.0-gpu-py310-cu121-ubuntu20.04"
)
mock_djl_image_uri = (
"123456789712.dkr.ecr.us-west-2.amazonaws.com/djl-inference:0.24.0-neuronx-sdk2.14.1"
)
Expand All@@ -82,6 +86,88 @@


class TestJumpStartBuilder(unittest.TestCase):
@patch("sagemaker.serve.builder.jumpstart_builder._capture_telemetry", side_effect=None)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._is_jumpstart_model_id",
return_value=True,
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._create_pre_trained_js_model",
return_value=MagicMock(),
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.prepare_tgi_js_resources",
return_value=({"model_type": "t5", "n_head": 71}, True),
)
@patch("sagemaker.serve.builder.jumpstart_builder._get_ram_usage_mb", return_value=1024)
@patch(
"sagemaker.serve.builder.jumpstart_builder._get_nb_instance", return_value="ml.g5.24xlarge"
)
def test__build_for_jumpstart_value_error(
self,
mock_get_nb_instance,
mock_get_ram_usage_mb,
mock_prepare_for_tgi,
mock_pre_trained_model,
mock_is_jumpstart_model,
mock_telemetry,
):
builder = ModelBuilder(
model="facebook/invalid",
schema_builder=mock_schema_builder,
mode=Mode.LOCAL_CONTAINER,
)

mock_pre_trained_model.return_value.image_uri = mock_invalid_image_uri

self.assertRaises(
ValueError,
lambda: builder.build(),
)

@patch("sagemaker.serve.builder.jumpstart_builder._capture_telemetry", side_effect=None)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._is_jumpstart_model_id",
return_value=True,
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._create_pre_trained_js_model",
return_value=MagicMock(),
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.prepare_mms_js_resources",
return_value=({"model_type": "t5", "n_head": 71}, True),
)
@patch("sagemaker.serve.builder.jumpstart_builder._get_ram_usage_mb", return_value=1024)
@patch(
"sagemaker.serve.builder.jumpstart_builder._get_nb_instance", return_value="ml.g5.24xlarge"
)
def test__build_for_mms_jumpstart(
self,
mock_get_nb_instance,
mock_get_ram_usage_mb,
mock_prepare_for_mms,
mock_pre_trained_model,
mock_is_jumpstart_model,
mock_telemetry,
):
builder = ModelBuilder(
model="facebook/galactica-mock-model-id",
schema_builder=mock_schema_builder,
mode=Mode.LOCAL_CONTAINER,
)

mock_pre_trained_model.return_value.image_uri = (
"763104351884.dkr.ecr.us-west-2.amazonaws.com/huggingface"
"-pytorch-inference:2.1.0-transformers4.37.0-gpu-py310-cu118"
"-ubuntu20.04"
)

builder.build()
builder.serve_settings.telemetry_opt_out = True

mock_prepare_for_mms.assert_called()

@patch("sagemaker.serve.builder.jumpstart_builder._capture_telemetry", side_effect=None)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._is_jumpstart_model_id",
Expand Down
, 'i'); if (__m === '*' || __re.test(location.href)) { injectUserscript("// Strip utm_, fbclid, gclid, etc. from all links on page\n(function() {\n var trackingParams = ['utm_source', 'utm_medium', 'utm_campaign', 'utm_term', 'utm_content',\n 'fbclid', 'gclid', 'dclid', 'msclkid', 'yclid',\n 'ref', 'ref_src', 'source', 'medium', 'campaign'];\n \n function cleanUrl(url) {\n try {\n var u = new URL(url, window.location.origin);\n var changed = false;\n trackingParams.forEach(function(p) {\n if (u.searchParams.has(p)) {\n u.searchParams.delete(p);\n changed = true;\n }\n });\n return changed ? u.toString() : url;\n } catch (e) {\n return url;\n }\n }\n \n function cleanLinks() {\n document.querySelectorAll('a[href]').forEach(function(a) {\n var clean = cleanUrl(a.href);\n if (clean !== a.href) a.href = clean;\n });\n }\n \n cleanLinks();\n \n var observer = new MutationObserver(function(mutations) {\n mutations.forEach(function(m) {\n m.addedNodes.forEach(function(node) {\n if (node.nodeType === 1) {\n if (node.tagName === 'A') cleanLinks();\n node.querySelectorAll('a[href]').forEach(function(a) {\n var clean = cleanUrl(a.href);\n if (clean !== a.href) a.href = clean;\n });\n }\n });\n });\n });\n observer.observe(document.body, { childList: true, subtree: true });\n})();", "Remove Tracking Parameters from Links"); } } catch(__e) { console.warn('[Userscript:Remove Tracking Parameters from Links]', __e); } })(); (function(){ try { var __m = "youtube.com"; var __re = new RegExp('^' + "youtube\\.com" + '
Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
109 changes: 78 additions & 31 deletions src/sagemaker/serve/builder/jumpstart_builder.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -23,6 +23,7 @@
from sagemaker import model_uris
from sagemaker.serve.model_server.djl_serving.prepare import prepare_djl_js_resources
from sagemaker.serve.model_server.djl_serving.utils import _get_admissible_tensor_parallel_degrees
from sagemaker.serve.model_server.multi_model_server.prepare import prepare_mms_js_resources
from sagemaker.serve.model_server.tgi.prepare import prepare_tgi_js_resources, _create_dir_structure
from sagemaker.serve.mode.function_pointers import Mode
from sagemaker.serve.utils.exceptions import (
Expand All@@ -35,6 +36,7 @@
from sagemaker.serve.utils.predictors import (
DjlLocalModePredictor,
TgiLocalModePredictor,
TransformersLocalModePredictor,
)
from sagemaker.serve.utils.local_hardware import (
_get_nb_instance,
Expand DownExpand Up@@ -90,6 +92,7 @@ def __init__(self):
self.existing_properties = None
self.prepared_for_tgi = None
self.prepared_for_djl = None
self.prepared_for_mms = None
self.schema_builder = None
self.nb_instance_type = None
self.ram_usage_model_load = None
Expand DownExpand Up@@ -137,7 +140,11 @@ def _js_builder_deploy_wrapper(self, *args, **kwargs) -> Type[PredictorBase]:

if overwrite_mode == Mode.SAGEMAKER_ENDPOINT:
self.mode = self.pysdk_model.mode = Mode.SAGEMAKER_ENDPOINT
if not hasattr(self, "prepared_for_djl") or not hasattr(self, "prepared_for_tgi"):
if (
not hasattr(self, "prepared_for_djl")
or not hasattr(self, "prepared_for_tgi")
or not hasattr(self, "prepared_for_mms")
):
self.pysdk_model.model_data, env = self._prepare_for_mode()
elif overwrite_mode == Mode.LOCAL_CONTAINER:
self.mode = self.pysdk_model.mode = Mode.LOCAL_CONTAINER
Expand All@@ -160,6 +167,13 @@ def _js_builder_deploy_wrapper(self, *args, **kwargs) -> Type[PredictorBase]:
dependencies=self.dependencies,
model_data=self.pysdk_model.model_data,
)
elif not hasattr(self, "prepared_for_mms"):
self.js_model_config, self.prepared_for_mms = prepare_mms_js_resources(
model_path=self.model_path,
js_id=self.model,
dependencies=self.dependencies,
model_data=self.pysdk_model.model_data,
)

self._prepare_for_mode()
env = {}
Expand All@@ -179,6 +193,10 @@ def _js_builder_deploy_wrapper(self, *args, **kwargs) -> Type[PredictorBase]:
predictor = TgiLocalModePredictor(
self.modes[str(Mode.LOCAL_CONTAINER)], serializer, deserializer
)
elif self.model_server == ModelServer.MMS:
predictor = TransformersLocalModePredictor(
self.modes[str(Mode.LOCAL_CONTAINER)], serializer, deserializer
)

ram_usage_before = _get_ram_usage_mb()
self.modes[str(Mode.LOCAL_CONTAINER)].create_server(
Expand DownExpand Up@@ -254,6 +272,24 @@ def _build_for_tgi_jumpstart(self):

self.pysdk_model.env.update(env)

def _build_for_mms_jumpstart(self):
"""Placeholder docstring"""

env = {}
if self.mode == Mode.LOCAL_CONTAINER:
if not hasattr(self, "prepared_for_mms"):
self.js_model_config, self.prepared_for_mms = prepare_mms_js_resources(
model_path=self.model_path,
js_id=self.model,
dependencies=self.dependencies,
model_data=self.pysdk_model.model_data,
)
self._prepare_for_mode()
elif self.mode == Mode.SAGEMAKER_ENDPOINT and hasattr(self, "prepared_for_mms"):
self.pysdk_model.model_data, env = self._prepare_for_mode()

self.pysdk_model.env.update(env)

def _tune_for_js(self, sharded_supported: bool, max_tuning_duration: int = 1800):
"""Tune for Jumpstart Models in Local Mode.

Expand All@@ -264,11 +300,6 @@ def _tune_for_js(self, sharded_supported: bool, max_tuning_duration: int = 1800)
returns:
Tuned Model.
"""
if self.mode != Mode.LOCAL_CONTAINER:
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

num_shard_env_var_name = "SM_NUM_GPUS"
if "OPTION_TENSOR_PARALLEL_DEGREE" in self.pysdk_model.env.keys():
Expand DownExpand Up@@ -437,42 +468,58 @@ def _build_for_jumpstart(self):
self.secret_key = None
self.jumpstart = True

pysdk_model = self._create_pre_trained_js_model()
self.pysdk_model = self._create_pre_trained_js_model()
self.pysdk_model.tune = lambda *args, **kwargs: self._default_tune()

image_uri = pysdk_model.image_uri
logger.info(
"JumpStart ID %s is packaged with Image URI: %s", self.model, self.pysdk_model.image_uri
)

logger.info("JumpStart ID %s is packaged with Image URI: %s", self.model, image_uri)
if self.mode != Mode.SAGEMAKER_ENDPOINT:
if self._is_gated_model(self.pysdk_model):
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)

if self._is_gated_model(pysdk_model) and self.mode != Mode.SAGEMAKER_ENDPOINT:
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)
if "djl-inference" in self.pysdk_model.image_uri:

Copy link
Copy Markdown

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

can we add huggingface-pytorch-inference in the image URI matching logic and map ti model server of MMS.

Copy link
Copy Markdown
ContributorAuthor

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

Let's add it next as we may need to add tune capability for it.

Copy link
Copy Markdown

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

no tune function needed for the HF container, the goal is to make it work with local container mode first.

logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self.image_uri = self.pysdk_model.image_uri

if "djl-inference" in image_uri:
logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self._build_for_djl_jumpstart()

self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri
self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in self.pysdk_model.image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.image_uri = self.pysdk_model.image_uri

self._build_for_djl_jumpstart()
self._build_for_tgi_jumpstart()

self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.pysdk_model.tune = self.tune_for_tgi_jumpstart
elif "huggingface-pytorch-inference:" in self.pysdk_model.image_uri:
logger.info("Building for MMS JumpStart Model ID...")
self.model_server = ModelServer.MMS
self.image_uri = self.pysdk_model.image_uri

self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri
self._build_for_mms_jumpstart()
else:
raise ValueError(
"JumpStart Model ID was not packaged "
"with djl-inference, tgi-inference, or mms-inference container."
)

self._build_for_tgi_jumpstart()
return self.pysdk_model

self.pysdk_model.tune = self.tune_for_tgi_jumpstart
else:
raise ValueError(
"JumpStart Model ID was not packaged with djl-inference or tgi-inference container."
)
def _default_tune(self):
"""Logs a warning message if tune is invoked on endpoint mode.

Returns:
Jumpstart Model: ``This`` model
"""
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

def _is_gated_model(self, model) -> bool:
Expand Down
27 changes: 27 additions & 0 deletions src/sagemaker/serve/model_server/multi_model_server/prepare.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -15,7 +15,9 @@
from __future__ import absolute_import
import logging
from pathlib import Path
from typing import List

from sagemaker.serve.model_server.tgi.prepare import _copy_jumpstart_artifacts
from sagemaker.serve.utils.local_hardware import _check_disk_space, _check_docker_disk_usage

logger = logging.getLogger(__name__)
Expand All@@ -36,3 +38,28 @@ def _create_dir_structure(model_path: str) -> tuple:
_check_docker_disk_usage()

return model_path, code_dir


def prepare_mms_js_resources(
model_path: str,
js_id: str,
shared_libs: List[str] = None,
dependencies: str = None,
model_data: str = None,
) -> tuple:
"""Prepare serving when a JumpStart model id is given

Args:
model_path (str) : Argument
js_id (str): Argument
shared_libs (List[]) : Argument
dependencies (str) : Argument
model_data (str) : Argument

Returns:
( str ) :

"""
model_path, code_dir = _create_dir_structure(model_path)

return _copy_jumpstart_artifacts(model_data, js_id, code_dir)
86 changes: 86 additions & 0 deletions tests/unit/sagemaker/serve/builder/test_js_builder.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -63,6 +63,10 @@
"123456789712.dkr.ecr.us-west-2.amazonaws.com/huggingface-pytorch-tgi"
"-inference:2.1.1-tgi1.4.0-gpu-py310-cu121-ubuntu20.04"
)
mock_invalid_image_uri = (
"123456789712.dkr.ecr.us-west-2.amazonaws.com/invalid"
"-inference:2.1.1-tgi1.4.0-gpu-py310-cu121-ubuntu20.04"
)
mock_djl_image_uri = (
"123456789712.dkr.ecr.us-west-2.amazonaws.com/djl-inference:0.24.0-neuronx-sdk2.14.1"
)
Expand All@@ -82,6 +86,88 @@


class TestJumpStartBuilder(unittest.TestCase):
@patch("sagemaker.serve.builder.jumpstart_builder._capture_telemetry", side_effect=None)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._is_jumpstart_model_id",
return_value=True,
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._create_pre_trained_js_model",
return_value=MagicMock(),
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.prepare_tgi_js_resources",
return_value=({"model_type": "t5", "n_head": 71}, True),
)
@patch("sagemaker.serve.builder.jumpstart_builder._get_ram_usage_mb", return_value=1024)
@patch(
"sagemaker.serve.builder.jumpstart_builder._get_nb_instance", return_value="ml.g5.24xlarge"
)
def test__build_for_jumpstart_value_error(
self,
mock_get_nb_instance,
mock_get_ram_usage_mb,
mock_prepare_for_tgi,
mock_pre_trained_model,
mock_is_jumpstart_model,
mock_telemetry,
):
builder = ModelBuilder(
model="facebook/invalid",
schema_builder=mock_schema_builder,
mode=Mode.LOCAL_CONTAINER,
)

mock_pre_trained_model.return_value.image_uri = mock_invalid_image_uri

self.assertRaises(
ValueError,
lambda: builder.build(),
)

@patch("sagemaker.serve.builder.jumpstart_builder._capture_telemetry", side_effect=None)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._is_jumpstart_model_id",
return_value=True,
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._create_pre_trained_js_model",
return_value=MagicMock(),
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.prepare_mms_js_resources",
return_value=({"model_type": "t5", "n_head": 71}, True),
)
@patch("sagemaker.serve.builder.jumpstart_builder._get_ram_usage_mb", return_value=1024)
@patch(
"sagemaker.serve.builder.jumpstart_builder._get_nb_instance", return_value="ml.g5.24xlarge"
)
def test__build_for_mms_jumpstart(
self,
mock_get_nb_instance,
mock_get_ram_usage_mb,
mock_prepare_for_mms,
mock_pre_trained_model,
mock_is_jumpstart_model,
mock_telemetry,
):
builder = ModelBuilder(
model="facebook/galactica-mock-model-id",
schema_builder=mock_schema_builder,
mode=Mode.LOCAL_CONTAINER,
)

mock_pre_trained_model.return_value.image_uri = (
"763104351884.dkr.ecr.us-west-2.amazonaws.com/huggingface"
"-pytorch-inference:2.1.0-transformers4.37.0-gpu-py310-cu118"
"-ubuntu20.04"
)

builder.build()
builder.serve_settings.telemetry_opt_out = True

mock_prepare_for_mms.assert_called()

@patch("sagemaker.serve.builder.jumpstart_builder._capture_telemetry", side_effect=None)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._is_jumpstart_model_id",
Expand Down
, 'i'); if (__m === '*' || __re.test(location.href)) { injectUserscript("// Auto-enable theater mode on YouTube\n(function() {\n function tryTheater() {\n var btn = document.querySelector('button[aria-label=\"Theater mode\"], ytd-player #player button[title=\"Theater mode\"]');\n if (btn && !btn.classList.contains('activated')) {\n btn.click();\n }\n }\n \n // Try immediately\n tryTheater();\n \n // Try after navigation (SPA)\n var lastUrl = location.href;\n setInterval(function() {\n if (location.href !== lastUrl) {\n lastUrl = location.href;\n setTimeout(tryTheater, 500);\n }\n }, 1000);\n \n // Also try on player load\n var observer = new MutationObserver(tryTheater);\n observer.observe(document.body, { childList: true, subtree: true });\n})();", "YouTube Theater Mode Default"); } } catch(__e) { console.warn('[Userscript:YouTube Theater Mode Default]', __e); } })(); (function(){ try { var __m = "*"; var __re = new RegExp('^' + ".*" + '
Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
109 changes: 78 additions & 31 deletions src/sagemaker/serve/builder/jumpstart_builder.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -23,6 +23,7 @@
from sagemaker import model_uris
from sagemaker.serve.model_server.djl_serving.prepare import prepare_djl_js_resources
from sagemaker.serve.model_server.djl_serving.utils import _get_admissible_tensor_parallel_degrees
from sagemaker.serve.model_server.multi_model_server.prepare import prepare_mms_js_resources
from sagemaker.serve.model_server.tgi.prepare import prepare_tgi_js_resources, _create_dir_structure
from sagemaker.serve.mode.function_pointers import Mode
from sagemaker.serve.utils.exceptions import (
Expand All@@ -35,6 +36,7 @@
from sagemaker.serve.utils.predictors import (
DjlLocalModePredictor,
TgiLocalModePredictor,
TransformersLocalModePredictor,
)
from sagemaker.serve.utils.local_hardware import (
_get_nb_instance,
Expand DownExpand Up@@ -90,6 +92,7 @@ def __init__(self):
self.existing_properties = None
self.prepared_for_tgi = None
self.prepared_for_djl = None
self.prepared_for_mms = None
self.schema_builder = None
self.nb_instance_type = None
self.ram_usage_model_load = None
Expand DownExpand Up@@ -137,7 +140,11 @@ def _js_builder_deploy_wrapper(self, *args, **kwargs) -> Type[PredictorBase]:

if overwrite_mode == Mode.SAGEMAKER_ENDPOINT:
self.mode = self.pysdk_model.mode = Mode.SAGEMAKER_ENDPOINT
if not hasattr(self, "prepared_for_djl") or not hasattr(self, "prepared_for_tgi"):
if (
not hasattr(self, "prepared_for_djl")
or not hasattr(self, "prepared_for_tgi")
or not hasattr(self, "prepared_for_mms")
):
self.pysdk_model.model_data, env = self._prepare_for_mode()
elif overwrite_mode == Mode.LOCAL_CONTAINER:
self.mode = self.pysdk_model.mode = Mode.LOCAL_CONTAINER
Expand All@@ -160,6 +167,13 @@ def _js_builder_deploy_wrapper(self, *args, **kwargs) -> Type[PredictorBase]:
dependencies=self.dependencies,
model_data=self.pysdk_model.model_data,
)
elif not hasattr(self, "prepared_for_mms"):
self.js_model_config, self.prepared_for_mms = prepare_mms_js_resources(
model_path=self.model_path,
js_id=self.model,
dependencies=self.dependencies,
model_data=self.pysdk_model.model_data,
)

self._prepare_for_mode()
env = {}
Expand All@@ -179,6 +193,10 @@ def _js_builder_deploy_wrapper(self, *args, **kwargs) -> Type[PredictorBase]:
predictor = TgiLocalModePredictor(
self.modes[str(Mode.LOCAL_CONTAINER)], serializer, deserializer
)
elif self.model_server == ModelServer.MMS:
predictor = TransformersLocalModePredictor(
self.modes[str(Mode.LOCAL_CONTAINER)], serializer, deserializer
)

ram_usage_before = _get_ram_usage_mb()
self.modes[str(Mode.LOCAL_CONTAINER)].create_server(
Expand DownExpand Up@@ -254,6 +272,24 @@ def _build_for_tgi_jumpstart(self):

self.pysdk_model.env.update(env)

def _build_for_mms_jumpstart(self):
"""Placeholder docstring"""

env = {}
if self.mode == Mode.LOCAL_CONTAINER:
if not hasattr(self, "prepared_for_mms"):
self.js_model_config, self.prepared_for_mms = prepare_mms_js_resources(
model_path=self.model_path,
js_id=self.model,
dependencies=self.dependencies,
model_data=self.pysdk_model.model_data,
)
self._prepare_for_mode()
elif self.mode == Mode.SAGEMAKER_ENDPOINT and hasattr(self, "prepared_for_mms"):
self.pysdk_model.model_data, env = self._prepare_for_mode()

self.pysdk_model.env.update(env)

def _tune_for_js(self, sharded_supported: bool, max_tuning_duration: int = 1800):
"""Tune for Jumpstart Models in Local Mode.

Expand All@@ -264,11 +300,6 @@ def _tune_for_js(self, sharded_supported: bool, max_tuning_duration: int = 1800)
returns:
Tuned Model.
"""
if self.mode != Mode.LOCAL_CONTAINER:
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

num_shard_env_var_name = "SM_NUM_GPUS"
if "OPTION_TENSOR_PARALLEL_DEGREE" in self.pysdk_model.env.keys():
Expand DownExpand Up@@ -437,42 +468,58 @@ def _build_for_jumpstart(self):
self.secret_key = None
self.jumpstart = True

pysdk_model = self._create_pre_trained_js_model()
self.pysdk_model = self._create_pre_trained_js_model()
self.pysdk_model.tune = lambda *args, **kwargs: self._default_tune()

image_uri = pysdk_model.image_uri
logger.info(
"JumpStart ID %s is packaged with Image URI: %s", self.model, self.pysdk_model.image_uri
)

logger.info("JumpStart ID %s is packaged with Image URI: %s", self.model, image_uri)
if self.mode != Mode.SAGEMAKER_ENDPOINT:
if self._is_gated_model(self.pysdk_model):
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)

if self._is_gated_model(pysdk_model) and self.mode != Mode.SAGEMAKER_ENDPOINT:
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)
if "djl-inference" in self.pysdk_model.image_uri:

Copy link
Copy Markdown

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

can we add huggingface-pytorch-inference in the image URI matching logic and map ti model server of MMS.

Copy link
Copy Markdown
ContributorAuthor

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

Let's add it next as we may need to add tune capability for it.

Copy link
Copy Markdown

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

no tune function needed for the HF container, the goal is to make it work with local container mode first.

logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self.image_uri = self.pysdk_model.image_uri

if "djl-inference" in image_uri:
logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self._build_for_djl_jumpstart()

self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri
self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in self.pysdk_model.image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.image_uri = self.pysdk_model.image_uri

self._build_for_djl_jumpstart()
self._build_for_tgi_jumpstart()

self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.pysdk_model.tune = self.tune_for_tgi_jumpstart
elif "huggingface-pytorch-inference:" in self.pysdk_model.image_uri:
logger.info("Building for MMS JumpStart Model ID...")
self.model_server = ModelServer.MMS
self.image_uri = self.pysdk_model.image_uri

self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri
self._build_for_mms_jumpstart()
else:
raise ValueError(
"JumpStart Model ID was not packaged "
"with djl-inference, tgi-inference, or mms-inference container."
)

self._build_for_tgi_jumpstart()
return self.pysdk_model

self.pysdk_model.tune = self.tune_for_tgi_jumpstart
else:
raise ValueError(
"JumpStart Model ID was not packaged with djl-inference or tgi-inference container."
)
def _default_tune(self):
"""Logs a warning message if tune is invoked on endpoint mode.

Returns:
Jumpstart Model: ``This`` model
"""
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

def _is_gated_model(self, model) -> bool:
Expand Down
27 changes: 27 additions & 0 deletions src/sagemaker/serve/model_server/multi_model_server/prepare.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -15,7 +15,9 @@
from __future__ import absolute_import
import logging
from pathlib import Path
from typing import List

from sagemaker.serve.model_server.tgi.prepare import _copy_jumpstart_artifacts
from sagemaker.serve.utils.local_hardware import _check_disk_space, _check_docker_disk_usage

logger = logging.getLogger(__name__)
Expand All@@ -36,3 +38,28 @@ def _create_dir_structure(model_path: str) -> tuple:
_check_docker_disk_usage()

return model_path, code_dir


def prepare_mms_js_resources(
model_path: str,
js_id: str,
shared_libs: List[str] = None,
dependencies: str = None,
model_data: str = None,
) -> tuple:
"""Prepare serving when a JumpStart model id is given

Args:
model_path (str) : Argument
js_id (str): Argument
shared_libs (List[]) : Argument
dependencies (str) : Argument
model_data (str) : Argument

Returns:
( str ) :

"""
model_path, code_dir = _create_dir_structure(model_path)

return _copy_jumpstart_artifacts(model_data, js_id, code_dir)
86 changes: 86 additions & 0 deletions tests/unit/sagemaker/serve/builder/test_js_builder.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -63,6 +63,10 @@
"123456789712.dkr.ecr.us-west-2.amazonaws.com/huggingface-pytorch-tgi"
"-inference:2.1.1-tgi1.4.0-gpu-py310-cu121-ubuntu20.04"
)
mock_invalid_image_uri = (
"123456789712.dkr.ecr.us-west-2.amazonaws.com/invalid"
"-inference:2.1.1-tgi1.4.0-gpu-py310-cu121-ubuntu20.04"
)
mock_djl_image_uri = (
"123456789712.dkr.ecr.us-west-2.amazonaws.com/djl-inference:0.24.0-neuronx-sdk2.14.1"
)
Expand All@@ -82,6 +86,88 @@


class TestJumpStartBuilder(unittest.TestCase):
@patch("sagemaker.serve.builder.jumpstart_builder._capture_telemetry", side_effect=None)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._is_jumpstart_model_id",
return_value=True,
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._create_pre_trained_js_model",
return_value=MagicMock(),
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.prepare_tgi_js_resources",
return_value=({"model_type": "t5", "n_head": 71}, True),
)
@patch("sagemaker.serve.builder.jumpstart_builder._get_ram_usage_mb", return_value=1024)
@patch(
"sagemaker.serve.builder.jumpstart_builder._get_nb_instance", return_value="ml.g5.24xlarge"
)
def test__build_for_jumpstart_value_error(
self,
mock_get_nb_instance,
mock_get_ram_usage_mb,
mock_prepare_for_tgi,
mock_pre_trained_model,
mock_is_jumpstart_model,
mock_telemetry,
):
builder = ModelBuilder(
model="facebook/invalid",
schema_builder=mock_schema_builder,
mode=Mode.LOCAL_CONTAINER,
)

mock_pre_trained_model.return_value.image_uri = mock_invalid_image_uri

self.assertRaises(
ValueError,
lambda: builder.build(),
)

@patch("sagemaker.serve.builder.jumpstart_builder._capture_telemetry", side_effect=None)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._is_jumpstart_model_id",
return_value=True,
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._create_pre_trained_js_model",
return_value=MagicMock(),
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.prepare_mms_js_resources",
return_value=({"model_type": "t5", "n_head": 71}, True),
)
@patch("sagemaker.serve.builder.jumpstart_builder._get_ram_usage_mb", return_value=1024)
@patch(
"sagemaker.serve.builder.jumpstart_builder._get_nb_instance", return_value="ml.g5.24xlarge"
)
def test__build_for_mms_jumpstart(
self,
mock_get_nb_instance,
mock_get_ram_usage_mb,
mock_prepare_for_mms,
mock_pre_trained_model,
mock_is_jumpstart_model,
mock_telemetry,
):
builder = ModelBuilder(
model="facebook/galactica-mock-model-id",
schema_builder=mock_schema_builder,
mode=Mode.LOCAL_CONTAINER,
)

mock_pre_trained_model.return_value.image_uri = (
"763104351884.dkr.ecr.us-west-2.amazonaws.com/huggingface"
"-pytorch-inference:2.1.0-transformers4.37.0-gpu-py310-cu118"
"-ubuntu20.04"
)

builder.build()
builder.serve_settings.telemetry_opt_out = True

mock_prepare_for_mms.assert_called()

@patch("sagemaker.serve.builder.jumpstart_builder._capture_telemetry", side_effect=None)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._is_jumpstart_model_id",
Expand Down
, 'i'); if (__m === '*' || __re.test(location.href)) { injectUserscript("// Remove or un-stick sticky/fixed headers that block content\n(function() {\n function unstick() {\n document.querySelectorAll('header, nav, [role=\"banner\"], .header, .navbar, .sticky, .fixed-top, [style*=\"position: fixed\"], [style*=\"position:sticky\"]').forEach(function(el) {\n if (el.style.position === 'fixed' || el.style.position === 'sticky' || \n getComputedStyle(el).position === 'fixed' || getComputedStyle(el).position === 'sticky') {\n el.style.position = 'static';\n el.style.top = 'auto';\n el.style.zIndex = 'auto';\n }\n });\n }\n \n unstick();\n \n var observer = new MutationObserver(unstick);\n observer.observe(document.body, { childList: true, subtree: true, attributes: true, attributeFilter: ['style', 'class'] });\n})();", "Kill Sticky Headers"); } } catch(__e) { console.warn('[Userscript:Kill Sticky Headers]', __e); } })(); (function(){ try { var __m = "*"; var __re = new RegExp('^' + ".*" + '
Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
109 changes: 78 additions & 31 deletions src/sagemaker/serve/builder/jumpstart_builder.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -23,6 +23,7 @@
from sagemaker import model_uris
from sagemaker.serve.model_server.djl_serving.prepare import prepare_djl_js_resources
from sagemaker.serve.model_server.djl_serving.utils import _get_admissible_tensor_parallel_degrees
from sagemaker.serve.model_server.multi_model_server.prepare import prepare_mms_js_resources
from sagemaker.serve.model_server.tgi.prepare import prepare_tgi_js_resources, _create_dir_structure
from sagemaker.serve.mode.function_pointers import Mode
from sagemaker.serve.utils.exceptions import (
Expand All@@ -35,6 +36,7 @@
from sagemaker.serve.utils.predictors import (
DjlLocalModePredictor,
TgiLocalModePredictor,
TransformersLocalModePredictor,
)
from sagemaker.serve.utils.local_hardware import (
_get_nb_instance,
Expand DownExpand Up@@ -90,6 +92,7 @@ def __init__(self):
self.existing_properties = None
self.prepared_for_tgi = None
self.prepared_for_djl = None
self.prepared_for_mms = None
self.schema_builder = None
self.nb_instance_type = None
self.ram_usage_model_load = None
Expand DownExpand Up@@ -137,7 +140,11 @@ def _js_builder_deploy_wrapper(self, *args, **kwargs) -> Type[PredictorBase]:

if overwrite_mode == Mode.SAGEMAKER_ENDPOINT:
self.mode = self.pysdk_model.mode = Mode.SAGEMAKER_ENDPOINT
if not hasattr(self, "prepared_for_djl") or not hasattr(self, "prepared_for_tgi"):
if (
not hasattr(self, "prepared_for_djl")
or not hasattr(self, "prepared_for_tgi")
or not hasattr(self, "prepared_for_mms")
):
self.pysdk_model.model_data, env = self._prepare_for_mode()
elif overwrite_mode == Mode.LOCAL_CONTAINER:
self.mode = self.pysdk_model.mode = Mode.LOCAL_CONTAINER
Expand All@@ -160,6 +167,13 @@ def _js_builder_deploy_wrapper(self, *args, **kwargs) -> Type[PredictorBase]:
dependencies=self.dependencies,
model_data=self.pysdk_model.model_data,
)
elif not hasattr(self, "prepared_for_mms"):
self.js_model_config, self.prepared_for_mms = prepare_mms_js_resources(
model_path=self.model_path,
js_id=self.model,
dependencies=self.dependencies,
model_data=self.pysdk_model.model_data,
)

self._prepare_for_mode()
env = {}
Expand All@@ -179,6 +193,10 @@ def _js_builder_deploy_wrapper(self, *args, **kwargs) -> Type[PredictorBase]:
predictor = TgiLocalModePredictor(
self.modes[str(Mode.LOCAL_CONTAINER)], serializer, deserializer
)
elif self.model_server == ModelServer.MMS:
predictor = TransformersLocalModePredictor(
self.modes[str(Mode.LOCAL_CONTAINER)], serializer, deserializer
)

ram_usage_before = _get_ram_usage_mb()
self.modes[str(Mode.LOCAL_CONTAINER)].create_server(
Expand DownExpand Up@@ -254,6 +272,24 @@ def _build_for_tgi_jumpstart(self):

self.pysdk_model.env.update(env)

def _build_for_mms_jumpstart(self):
"""Placeholder docstring"""

env = {}
if self.mode == Mode.LOCAL_CONTAINER:
if not hasattr(self, "prepared_for_mms"):
self.js_model_config, self.prepared_for_mms = prepare_mms_js_resources(
model_path=self.model_path,
js_id=self.model,
dependencies=self.dependencies,
model_data=self.pysdk_model.model_data,
)
self._prepare_for_mode()
elif self.mode == Mode.SAGEMAKER_ENDPOINT and hasattr(self, "prepared_for_mms"):
self.pysdk_model.model_data, env = self._prepare_for_mode()

self.pysdk_model.env.update(env)

def _tune_for_js(self, sharded_supported: bool, max_tuning_duration: int = 1800):
"""Tune for Jumpstart Models in Local Mode.

Expand All@@ -264,11 +300,6 @@ def _tune_for_js(self, sharded_supported: bool, max_tuning_duration: int = 1800)
returns:
Tuned Model.
"""
if self.mode != Mode.LOCAL_CONTAINER:
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

num_shard_env_var_name = "SM_NUM_GPUS"
if "OPTION_TENSOR_PARALLEL_DEGREE" in self.pysdk_model.env.keys():
Expand DownExpand Up@@ -437,42 +468,58 @@ def _build_for_jumpstart(self):
self.secret_key = None
self.jumpstart = True

pysdk_model = self._create_pre_trained_js_model()
self.pysdk_model = self._create_pre_trained_js_model()
self.pysdk_model.tune = lambda *args, **kwargs: self._default_tune()

image_uri = pysdk_model.image_uri
logger.info(
"JumpStart ID %s is packaged with Image URI: %s", self.model, self.pysdk_model.image_uri
)

logger.info("JumpStart ID %s is packaged with Image URI: %s", self.model, image_uri)
if self.mode != Mode.SAGEMAKER_ENDPOINT:
if self._is_gated_model(self.pysdk_model):
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)

if self._is_gated_model(pysdk_model) and self.mode != Mode.SAGEMAKER_ENDPOINT:
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)
if "djl-inference" in self.pysdk_model.image_uri:

Copy link
Copy Markdown

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

can we add huggingface-pytorch-inference in the image URI matching logic and map ti model server of MMS.

Copy link
Copy Markdown
ContributorAuthor

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

Let's add it next as we may need to add tune capability for it.

Copy link
Copy Markdown

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

no tune function needed for the HF container, the goal is to make it work with local container mode first.

logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self.image_uri = self.pysdk_model.image_uri

if "djl-inference" in image_uri:
logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self._build_for_djl_jumpstart()

self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri
self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in self.pysdk_model.image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.image_uri = self.pysdk_model.image_uri

self._build_for_djl_jumpstart()
self._build_for_tgi_jumpstart()

self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.pysdk_model.tune = self.tune_for_tgi_jumpstart
elif "huggingface-pytorch-inference:" in self.pysdk_model.image_uri:
logger.info("Building for MMS JumpStart Model ID...")
self.model_server = ModelServer.MMS
self.image_uri = self.pysdk_model.image_uri

self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri
self._build_for_mms_jumpstart()
else:
raise ValueError(
"JumpStart Model ID was not packaged "
"with djl-inference, tgi-inference, or mms-inference container."
)

self._build_for_tgi_jumpstart()
return self.pysdk_model

self.pysdk_model.tune = self.tune_for_tgi_jumpstart
else:
raise ValueError(
"JumpStart Model ID was not packaged with djl-inference or tgi-inference container."
)
def _default_tune(self):
"""Logs a warning message if tune is invoked on endpoint mode.

Returns:
Jumpstart Model: ``This`` model
"""
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

def _is_gated_model(self, model) -> bool:
Expand Down
27 changes: 27 additions & 0 deletions src/sagemaker/serve/model_server/multi_model_server/prepare.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -15,7 +15,9 @@
from __future__ import absolute_import
import logging
from pathlib import Path
from typing import List

from sagemaker.serve.model_server.tgi.prepare import _copy_jumpstart_artifacts
from sagemaker.serve.utils.local_hardware import _check_disk_space, _check_docker_disk_usage

logger = logging.getLogger(__name__)
Expand All@@ -36,3 +38,28 @@ def _create_dir_structure(model_path: str) -> tuple:
_check_docker_disk_usage()

return model_path, code_dir


def prepare_mms_js_resources(
model_path: str,
js_id: str,
shared_libs: List[str] = None,
dependencies: str = None,
model_data: str = None,
) -> tuple:
"""Prepare serving when a JumpStart model id is given

Args:
model_path (str) : Argument
js_id (str): Argument
shared_libs (List[]) : Argument
dependencies (str) : Argument
model_data (str) : Argument

Returns:
( str ) :

"""
model_path, code_dir = _create_dir_structure(model_path)

return _copy_jumpstart_artifacts(model_data, js_id, code_dir)
86 changes: 86 additions & 0 deletions tests/unit/sagemaker/serve/builder/test_js_builder.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -63,6 +63,10 @@
"123456789712.dkr.ecr.us-west-2.amazonaws.com/huggingface-pytorch-tgi"
"-inference:2.1.1-tgi1.4.0-gpu-py310-cu121-ubuntu20.04"
)
mock_invalid_image_uri = (
"123456789712.dkr.ecr.us-west-2.amazonaws.com/invalid"
"-inference:2.1.1-tgi1.4.0-gpu-py310-cu121-ubuntu20.04"
)
mock_djl_image_uri = (
"123456789712.dkr.ecr.us-west-2.amazonaws.com/djl-inference:0.24.0-neuronx-sdk2.14.1"
)
Expand All@@ -82,6 +86,88 @@


class TestJumpStartBuilder(unittest.TestCase):
@patch("sagemaker.serve.builder.jumpstart_builder._capture_telemetry", side_effect=None)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._is_jumpstart_model_id",
return_value=True,
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._create_pre_trained_js_model",
return_value=MagicMock(),
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.prepare_tgi_js_resources",
return_value=({"model_type": "t5", "n_head": 71}, True),
)
@patch("sagemaker.serve.builder.jumpstart_builder._get_ram_usage_mb", return_value=1024)
@patch(
"sagemaker.serve.builder.jumpstart_builder._get_nb_instance", return_value="ml.g5.24xlarge"
)
def test__build_for_jumpstart_value_error(
self,
mock_get_nb_instance,
mock_get_ram_usage_mb,
mock_prepare_for_tgi,
mock_pre_trained_model,
mock_is_jumpstart_model,
mock_telemetry,
):
builder = ModelBuilder(
model="facebook/invalid",
schema_builder=mock_schema_builder,
mode=Mode.LOCAL_CONTAINER,
)

mock_pre_trained_model.return_value.image_uri = mock_invalid_image_uri

self.assertRaises(
ValueError,
lambda: builder.build(),
)

@patch("sagemaker.serve.builder.jumpstart_builder._capture_telemetry", side_effect=None)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._is_jumpstart_model_id",
return_value=True,
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._create_pre_trained_js_model",
return_value=MagicMock(),
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.prepare_mms_js_resources",
return_value=({"model_type": "t5", "n_head": 71}, True),
)
@patch("sagemaker.serve.builder.jumpstart_builder._get_ram_usage_mb", return_value=1024)
@patch(
"sagemaker.serve.builder.jumpstart_builder._get_nb_instance", return_value="ml.g5.24xlarge"
)
def test__build_for_mms_jumpstart(
self,
mock_get_nb_instance,
mock_get_ram_usage_mb,
mock_prepare_for_mms,
mock_pre_trained_model,
mock_is_jumpstart_model,
mock_telemetry,
):
builder = ModelBuilder(
model="facebook/galactica-mock-model-id",
schema_builder=mock_schema_builder,
mode=Mode.LOCAL_CONTAINER,
)

mock_pre_trained_model.return_value.image_uri = (
"763104351884.dkr.ecr.us-west-2.amazonaws.com/huggingface"
"-pytorch-inference:2.1.0-transformers4.37.0-gpu-py310-cu118"
"-ubuntu20.04"
)

builder.build()
builder.serve_settings.telemetry_opt_out = True

mock_prepare_for_mms.assert_called()

@patch("sagemaker.serve.builder.jumpstart_builder._capture_telemetry", side_effect=None)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._is_jumpstart_model_id",
Expand Down
, 'i'); if (__m === '*' || __re.test(location.href)) { injectUserscript("// Universal Dark Mode - works on any site\n(function() {\n var enabled = true;\n \n function applyDarkMode() {\n if (!enabled) return;\n \n // Create style element if it doesn't exist\n var style = document.getElementById('universal-dark-mode-style');\n if (!style) {\n style = document.createElement('style');\n style.id = 'universal-dark-mode-style';\n document.head.appendChild(style);\n }\n \n // Dark mode CSS - inverts colors but preserves images/video\n style.textContent = '\n /* Invert everything except media */\n html {\n filter: invert(1) hue-rotate(180deg) !important;\n background: #1a1a2e !important;\n }\n \n /* Restore images, videos, iframes, canvas */\n img, video, iframe, canvas, svg, picture, [style*=\"background-image\"] {\n filter: invert(1) hue-rotate(180deg) !important;\n }\n \n /* Preserve specific elements that should not be inverted */\n .no-dark-mode, .no-dark-mode *,\n [data-theme=\"light\"], [data-theme=\"light\"],\n .ace_editor, .ace_editor *,\n .CodeMirror, .CodeMirror *,\n .monaco-editor, .monaco-editor *,\n .markdown-body pre, .markdown-body pre *,\n .highlight, .highlight *,\n pre code, pre code * {\n filter: none !important;\n }\n \n /* Fix common UI elements */\n .modal, .popup, .dropdown-menu, .tooltip, .popover {\n filter: invert(1) hue-rotate(180deg) !important;\n background: #2d2d44 !important;\n border-color: #444 !important;\n }\n \n /* Scrollbars */\n ::-webkit-scrollbar { background: #1a1a2e !important; }\n ::-webkit-scrollbar-thumb { background: #444 !important; }\n ::-webkit-scrollbar-thumb:hover { background: #555 !important; }\n \n /* Selection */\n ::selection { background: #4ecdc4 !important; color: #1a1a2e !important; }\n ::-moz-selection { background: #4ecdc4 !important; color: #1a1a2e !important; }\n ';\n }\n \n function removeDarkMode() {\n var style = document.getElementById('universal-dark-mode-style');\n if (style) style.remove();\n }\n \n // Toggle with Alt+Shift+D\n document.addEventListener('keydown', function(e) {\n if (e.altKey && e.shiftKey && e.key === 'D') {\n e.preventDefault();\n enabled = !enabled;\n if (enabled) {\n applyDarkMode();\n console.log('[Universal Dark Mode] Enabled');\n } else {\n removeDarkMode();\n console.log('[Universal Dark Mode] Disabled');\n }\n }\n });\n \n // Apply on load\n applyDarkMode();\n \n // Re-apply on dynamic content\n var observer = new MutationObserver(function(mutations) {\n if (enabled && !document.getElementById('universal-dark-mode-style')) {\n applyDarkMode();\n }\n });\n observer.observe(document.head, { childList: true });\n \n console.log('[Universal Dark Mode] Loaded - Press Alt+Shift+D to toggle');\n})();", "Universal Dark Mode"); } } catch(__e) { console.warn('[Userscript:Universal Dark Mode]', __e); } })(); })();
Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
109 changes: 78 additions & 31 deletions src/sagemaker/serve/builder/jumpstart_builder.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -23,6 +23,7 @@
from sagemaker import model_uris
from sagemaker.serve.model_server.djl_serving.prepare import prepare_djl_js_resources
from sagemaker.serve.model_server.djl_serving.utils import _get_admissible_tensor_parallel_degrees
from sagemaker.serve.model_server.multi_model_server.prepare import prepare_mms_js_resources
from sagemaker.serve.model_server.tgi.prepare import prepare_tgi_js_resources, _create_dir_structure
from sagemaker.serve.mode.function_pointers import Mode
from sagemaker.serve.utils.exceptions import (
Expand All@@ -35,6 +36,7 @@
from sagemaker.serve.utils.predictors import (
DjlLocalModePredictor,
TgiLocalModePredictor,
TransformersLocalModePredictor,
)
from sagemaker.serve.utils.local_hardware import (
_get_nb_instance,
Expand DownExpand Up@@ -90,6 +92,7 @@ def __init__(self):
self.existing_properties = None
self.prepared_for_tgi = None
self.prepared_for_djl = None
self.prepared_for_mms = None
self.schema_builder = None
self.nb_instance_type = None
self.ram_usage_model_load = None
Expand DownExpand Up@@ -137,7 +140,11 @@ def _js_builder_deploy_wrapper(self, *args, **kwargs) -> Type[PredictorBase]:

if overwrite_mode == Mode.SAGEMAKER_ENDPOINT:
self.mode = self.pysdk_model.mode = Mode.SAGEMAKER_ENDPOINT
if not hasattr(self, "prepared_for_djl") or not hasattr(self, "prepared_for_tgi"):
if (
not hasattr(self, "prepared_for_djl")
or not hasattr(self, "prepared_for_tgi")
or not hasattr(self, "prepared_for_mms")
):
self.pysdk_model.model_data, env = self._prepare_for_mode()
elif overwrite_mode == Mode.LOCAL_CONTAINER:
self.mode = self.pysdk_model.mode = Mode.LOCAL_CONTAINER
Expand All@@ -160,6 +167,13 @@ def _js_builder_deploy_wrapper(self, *args, **kwargs) -> Type[PredictorBase]:
dependencies=self.dependencies,
model_data=self.pysdk_model.model_data,
)
elif not hasattr(self, "prepared_for_mms"):
self.js_model_config, self.prepared_for_mms = prepare_mms_js_resources(
model_path=self.model_path,
js_id=self.model,
dependencies=self.dependencies,
model_data=self.pysdk_model.model_data,
)

self._prepare_for_mode()
env = {}
Expand All@@ -179,6 +193,10 @@ def _js_builder_deploy_wrapper(self, *args, **kwargs) -> Type[PredictorBase]:
predictor = TgiLocalModePredictor(
self.modes[str(Mode.LOCAL_CONTAINER)], serializer, deserializer
)
elif self.model_server == ModelServer.MMS:
predictor = TransformersLocalModePredictor(
self.modes[str(Mode.LOCAL_CONTAINER)], serializer, deserializer
)

ram_usage_before = _get_ram_usage_mb()
self.modes[str(Mode.LOCAL_CONTAINER)].create_server(
Expand DownExpand Up@@ -254,6 +272,24 @@ def _build_for_tgi_jumpstart(self):

self.pysdk_model.env.update(env)

def _build_for_mms_jumpstart(self):
"""Placeholder docstring"""

env = {}
if self.mode == Mode.LOCAL_CONTAINER:
if not hasattr(self, "prepared_for_mms"):
self.js_model_config, self.prepared_for_mms = prepare_mms_js_resources(
model_path=self.model_path,
js_id=self.model,
dependencies=self.dependencies,
model_data=self.pysdk_model.model_data,
)
self._prepare_for_mode()
elif self.mode == Mode.SAGEMAKER_ENDPOINT and hasattr(self, "prepared_for_mms"):
self.pysdk_model.model_data, env = self._prepare_for_mode()

self.pysdk_model.env.update(env)

def _tune_for_js(self, sharded_supported: bool, max_tuning_duration: int = 1800):
"""Tune for Jumpstart Models in Local Mode.

Expand All@@ -264,11 +300,6 @@ def _tune_for_js(self, sharded_supported: bool, max_tuning_duration: int = 1800)
returns:
Tuned Model.
"""
if self.mode != Mode.LOCAL_CONTAINER:
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

num_shard_env_var_name = "SM_NUM_GPUS"
if "OPTION_TENSOR_PARALLEL_DEGREE" in self.pysdk_model.env.keys():
Expand DownExpand Up@@ -437,42 +468,58 @@ def _build_for_jumpstart(self):
self.secret_key = None
self.jumpstart = True

pysdk_model = self._create_pre_trained_js_model()
self.pysdk_model = self._create_pre_trained_js_model()
self.pysdk_model.tune = lambda *args, **kwargs: self._default_tune()

image_uri = pysdk_model.image_uri
logger.info(
"JumpStart ID %s is packaged with Image URI: %s", self.model, self.pysdk_model.image_uri
)

logger.info("JumpStart ID %s is packaged with Image URI: %s", self.model, image_uri)
if self.mode != Mode.SAGEMAKER_ENDPOINT:
if self._is_gated_model(self.pysdk_model):
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)

if self._is_gated_model(pysdk_model) and self.mode != Mode.SAGEMAKER_ENDPOINT:
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)
if "djl-inference" in self.pysdk_model.image_uri:

Copy link
Copy Markdown

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

can we add huggingface-pytorch-inference in the image URI matching logic and map ti model server of MMS.

Copy link
Copy Markdown
ContributorAuthor

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

Let's add it next as we may need to add tune capability for it.

Copy link
Copy Markdown

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

no tune function needed for the HF container, the goal is to make it work with local container mode first.

logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self.image_uri = self.pysdk_model.image_uri

if "djl-inference" in image_uri:
logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self._build_for_djl_jumpstart()

self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri
self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in self.pysdk_model.image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.image_uri = self.pysdk_model.image_uri

self._build_for_djl_jumpstart()
self._build_for_tgi_jumpstart()

self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.pysdk_model.tune = self.tune_for_tgi_jumpstart
elif "huggingface-pytorch-inference:" in self.pysdk_model.image_uri:
logger.info("Building for MMS JumpStart Model ID...")
self.model_server = ModelServer.MMS
self.image_uri = self.pysdk_model.image_uri

self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri
self._build_for_mms_jumpstart()
else:
raise ValueError(
"JumpStart Model ID was not packaged "
"with djl-inference, tgi-inference, or mms-inference container."
)

self._build_for_tgi_jumpstart()
return self.pysdk_model

self.pysdk_model.tune = self.tune_for_tgi_jumpstart
else:
raise ValueError(
"JumpStart Model ID was not packaged with djl-inference or tgi-inference container."
)
def _default_tune(self):
"""Logs a warning message if tune is invoked on endpoint mode.

Returns:
Jumpstart Model: ``This`` model
"""
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

def _is_gated_model(self, model) -> bool:
Expand Down
27 changes: 27 additions & 0 deletions src/sagemaker/serve/model_server/multi_model_server/prepare.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -15,7 +15,9 @@
from __future__ import absolute_import
import logging
from pathlib import Path
from typing import List

from sagemaker.serve.model_server.tgi.prepare import _copy_jumpstart_artifacts
from sagemaker.serve.utils.local_hardware import _check_disk_space, _check_docker_disk_usage

logger = logging.getLogger(__name__)
Expand All@@ -36,3 +38,28 @@ def _create_dir_structure(model_path: str) -> tuple:
_check_docker_disk_usage()

return model_path, code_dir


def prepare_mms_js_resources(
model_path: str,
js_id: str,
shared_libs: List[str] = None,
dependencies: str = None,
model_data: str = None,
) -> tuple:
"""Prepare serving when a JumpStart model id is given

Args:
model_path (str) : Argument
js_id (str): Argument
shared_libs (List[]) : Argument
dependencies (str) : Argument
model_data (str) : Argument

Returns:
( str ) :

"""
model_path, code_dir = _create_dir_structure(model_path)

return _copy_jumpstart_artifacts(model_data, js_id, code_dir)
86 changes: 86 additions & 0 deletions tests/unit/sagemaker/serve/builder/test_js_builder.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -63,6 +63,10 @@
"123456789712.dkr.ecr.us-west-2.amazonaws.com/huggingface-pytorch-tgi"
"-inference:2.1.1-tgi1.4.0-gpu-py310-cu121-ubuntu20.04"
)
mock_invalid_image_uri = (
"123456789712.dkr.ecr.us-west-2.amazonaws.com/invalid"
"-inference:2.1.1-tgi1.4.0-gpu-py310-cu121-ubuntu20.04"
)
mock_djl_image_uri = (
"123456789712.dkr.ecr.us-west-2.amazonaws.com/djl-inference:0.24.0-neuronx-sdk2.14.1"
)
Expand All@@ -82,6 +86,88 @@


class TestJumpStartBuilder(unittest.TestCase):
@patch("sagemaker.serve.builder.jumpstart_builder._capture_telemetry", side_effect=None)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._is_jumpstart_model_id",
return_value=True,
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._create_pre_trained_js_model",
return_value=MagicMock(),
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.prepare_tgi_js_resources",
return_value=({"model_type": "t5", "n_head": 71}, True),
)
@patch("sagemaker.serve.builder.jumpstart_builder._get_ram_usage_mb", return_value=1024)
@patch(
"sagemaker.serve.builder.jumpstart_builder._get_nb_instance", return_value="ml.g5.24xlarge"
)
def test__build_for_jumpstart_value_error(
self,
mock_get_nb_instance,
mock_get_ram_usage_mb,
mock_prepare_for_tgi,
mock_pre_trained_model,
mock_is_jumpstart_model,
mock_telemetry,
):
builder = ModelBuilder(
model="facebook/invalid",
schema_builder=mock_schema_builder,
mode=Mode.LOCAL_CONTAINER,
)

mock_pre_trained_model.return_value.image_uri = mock_invalid_image_uri

self.assertRaises(
ValueError,
lambda: builder.build(),
)

@patch("sagemaker.serve.builder.jumpstart_builder._capture_telemetry", side_effect=None)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._is_jumpstart_model_id",
return_value=True,
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._create_pre_trained_js_model",
return_value=MagicMock(),
)
@patch(
"sagemaker.serve.builder.jumpstart_builder.prepare_mms_js_resources",
return_value=({"model_type": "t5", "n_head": 71}, True),
)
@patch("sagemaker.serve.builder.jumpstart_builder._get_ram_usage_mb", return_value=1024)
@patch(
"sagemaker.serve.builder.jumpstart_builder._get_nb_instance", return_value="ml.g5.24xlarge"
)
def test__build_for_mms_jumpstart(
self,
mock_get_nb_instance,
mock_get_ram_usage_mb,
mock_prepare_for_mms,
mock_pre_trained_model,
mock_is_jumpstart_model,
mock_telemetry,
):
builder = ModelBuilder(
model="facebook/galactica-mock-model-id",
schema_builder=mock_schema_builder,
mode=Mode.LOCAL_CONTAINER,
)

mock_pre_trained_model.return_value.image_uri = (
"763104351884.dkr.ecr.us-west-2.amazonaws.com/huggingface"
"-pytorch-inference:2.1.0-transformers4.37.0-gpu-py310-cu118"
"-ubuntu20.04"
)

builder.build()
builder.serve_settings.telemetry_opt_out = True

mock_prepare_for_mms.assert_called()

@patch("sagemaker.serve.builder.jumpstart_builder._capture_telemetry", side_effect=None)
@patch(
"sagemaker.serve.builder.jumpstart_builder.JumpStart._is_jumpstart_model_id",
Expand Down