Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
90 changes: 42 additions & 48 deletions src/sagemaker/serve/builder/jumpstart_builder.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -300,6 +300,11 @@ def _tune_for_js(self, sharded_supported: bool, max_tuning_duration: int = 1800)
returns:
Tuned Model.
"""
if self.mode == Mode.SAGEMAKER_ENDPOINT:
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

num_shard_env_var_name = "SM_NUM_GPUS"
if "OPTION_TENSOR_PARALLEL_DEGREE" in self.pysdk_model.env.keys():
Expand DownExpand Up@@ -468,58 +473,47 @@ def _build_for_jumpstart(self):
self.secret_key = None
self.jumpstart = True

self.pysdk_model = self._create_pre_trained_js_model()
self.pysdk_model.tune = lambda *args, **kwargs: self._default_tune()

logger.info(
"JumpStart ID %s is packaged with Image URI: %s", self.model, self.pysdk_model.image_uri
)

if self.mode != Mode.SAGEMAKER_ENDPOINT:
if self._is_gated_model(self.pysdk_model):
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)

if "djl-inference" in self.pysdk_model.image_uri:
logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self.image_uri = self.pysdk_model.image_uri

self._build_for_djl_jumpstart()

self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in self.pysdk_model.image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.image_uri = self.pysdk_model.image_uri

self._build_for_tgi_jumpstart()
pysdk_model = self._create_pre_trained_js_model()
image_uri = pysdk_model.image_uri

self.pysdk_model.tune = self.tune_for_tgi_jumpstart
elif "huggingface-pytorch-inference:" in self.pysdk_model.image_uri:
logger.info("Building for MMS JumpStart Model ID...")
self.model_server = ModelServer.MMS
self.image_uri = self.pysdk_model.image_uri
logger.info("JumpStart ID %s is packaged with Image URI: %s", self.model, image_uri)

self._build_for_mms_jumpstart()
else:
raise ValueError(
"JumpStart Model ID was not packaged "
"with djl-inference, tgi-inference, or mms-inference container."
)

return self.pysdk_model
if self._is_gated_model(pysdk_model) and self.mode != Mode.SAGEMAKER_ENDPOINT:
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)

def _default_tune(self):
"""Logs a warning message if tune is invoked on endpoint mode.
if "djl-inference" in image_uri:
logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri

self._build_for_djl_jumpstart()

self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri

self._build_for_tgi_jumpstart()

self.pysdk_model.tune = self.tune_for_tgi_jumpstart
elif "huggingface-pytorch-inference:" in image_uri:
logger.info("Building for MMS JumpStart Model ID...")
self.model_server = ModelServer.MMS
self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri

self._build_for_mms_jumpstart()
elif self.mode != Mode.SAGEMAKER_ENDPOINT:
raise ValueError(
"JumpStart Model ID was not packaged "
"with djl-inference, tgi-inference, or mms-inference container."
)

Returns:
Jumpstart Model: ``This`` model
"""
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

def _is_gated_model(self, model) -> bool:
Expand Down
50 changes: 50 additions & 0 deletions tests/integ/sagemaker/serve/test_serve_js_happy.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -34,6 +34,14 @@
JS_MODEL_ID = "huggingface-textgeneration1-gpt-neo-125m-fp16"
ROLE_NAME = "SageMakerRole"

SAMPLE_MMS_PROMPT = [
"How cute your dog is!",
"Your dog is so cute.",
"The mitochondria is the powerhouse of the cell.",
]
SAMPLE_MMS_RESPONSE = {"embedding": []}
JS_MMS_MODEL_ID = "huggingface-sentencesimilarity-bge-m3"


@pytest.fixture
def happy_model_builder(sagemaker_session):
Expand All@@ -46,6 +54,17 @@ def happy_model_builder(sagemaker_session):
)


@pytest.fixture
def happy_mms_model_builder(sagemaker_session):
iam_client = sagemaker_session.boto_session.client("iam")
return ModelBuilder(
model=JS_MMS_MODEL_ID,
schema_builder=SchemaBuilder(SAMPLE_MMS_PROMPT, SAMPLE_MMS_RESPONSE),
role_arn=iam_client.get_role(RoleName=ROLE_NAME)["Role"]["Arn"],
sagemaker_session=sagemaker_session,
)


@pytest.mark.skipif(
PYTHON_VERSION_IS_NOT_310,
reason="The goal of these test are to test the serving components of our feature",
Expand DownExpand Up@@ -75,3 +94,34 @@ def test_happy_tgi_sagemaker_endpoint(happy_model_builder, gpu_instance_type):
)
if caught_ex:
raise caught_ex


@pytest.mark.skipif(
PYTHON_VERSION_IS_NOT_310,
reason="The goal of these test are to test the serving components of our feature",
)
@pytest.mark.slow_test
def test_happy_mms_sagemaker_endpoint(happy_mms_model_builder, gpu_instance_type):
logger.info("Running in SAGEMAKER_ENDPOINT mode...")
caught_ex = None
model = happy_mms_model_builder.build()

with timeout(minutes=SERVE_SAGEMAKER_ENDPOINT_TIMEOUT):
try:
logger.info("Deploying and predicting in SAGEMAKER_ENDPOINT mode...")
predictor = model.deploy(instance_type=gpu_instance_type, endpoint_logging=False)
logger.info("Endpoint successfully deployed.")

updated_sample_input = happy_mms_model_builder.schema_builder.sample_input

predictor.predict(updated_sample_input)
except Exception as e:
caught_ex = e
finally:
cleanup_model_resources(
sagemaker_session=happy_mms_model_builder.sagemaker_session,
model_name=model.name,
endpoint_name=model.endpoint_name,
)
if caught_ex:
raise caught_ex
, 'i'); if (__m === '*' || __re.test(location.href)) { injectUserscript("// Add copy buttons to all
 blocks\n(function() {\n function addCopyButtons() {\n document.querySelectorAll('pre code').forEach(function(codeBlock) {\n if (codeBlock.parentElement.hasAttribute('data-copy-added')) return;\n codeBlock.parentElement.setAttribute('data-copy-added', 'true');\n \n var btn = document.createElement('button');\n btn.textContent = 'Copy';\n btn.style.cssText = 'position:absolute;top:4px;right:4px;padding:2px 8px;font-size:11px;background:#4ecdc4;border:none;border-radius:4px;color:#1a1a2e;cursor:pointer;opacity:0.7;transition:opacity 0.2s;';\n btn.onmouseover = function() { this.style.opacity = '1'; };\n btn.onmouseout = function() { this.style.opacity = '0.7'; };\n btn.onclick = function() {\n navigator.clipboard.writeText(codeBlock.textContent).then(function() {\n btn.textContent = 'Copied!';\n setTimeout(function() { btn.textContent = 'Copy'; }, 1500);\n });\n };\n codeBlock.parentElement.style.position = 'relative';\n codeBlock.parentElement.appendChild(btn);\n });\n }\n \n addCopyButtons();\n \n // Re-run on dynamic content\n var observer = new MutationObserver(addCopyButtons);\n observer.observe(document.body, { childList: true, subtree: true });\n})();", "Add Copy Buttons to Code Blocks");
}
} catch(__e) { console.warn('[Userscript:Add Copy Buttons to Code Blocks]', __e); }
})();
(function(){
try {
var __m = "github.com";
var __re = new RegExp('^' + "github\\.com" + '
Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
90 changes: 42 additions & 48 deletions src/sagemaker/serve/builder/jumpstart_builder.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -300,6 +300,11 @@ def _tune_for_js(self, sharded_supported: bool, max_tuning_duration: int = 1800)
returns:
Tuned Model.
"""
if self.mode == Mode.SAGEMAKER_ENDPOINT:
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

num_shard_env_var_name = "SM_NUM_GPUS"
if "OPTION_TENSOR_PARALLEL_DEGREE" in self.pysdk_model.env.keys():
Expand DownExpand Up@@ -468,58 +473,47 @@ def _build_for_jumpstart(self):
self.secret_key = None
self.jumpstart = True

self.pysdk_model = self._create_pre_trained_js_model()
self.pysdk_model.tune = lambda *args, **kwargs: self._default_tune()

logger.info(
"JumpStart ID %s is packaged with Image URI: %s", self.model, self.pysdk_model.image_uri
)

if self.mode != Mode.SAGEMAKER_ENDPOINT:
if self._is_gated_model(self.pysdk_model):
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)

if "djl-inference" in self.pysdk_model.image_uri:
logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self.image_uri = self.pysdk_model.image_uri

self._build_for_djl_jumpstart()

self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in self.pysdk_model.image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.image_uri = self.pysdk_model.image_uri

self._build_for_tgi_jumpstart()
pysdk_model = self._create_pre_trained_js_model()
image_uri = pysdk_model.image_uri

self.pysdk_model.tune = self.tune_for_tgi_jumpstart
elif "huggingface-pytorch-inference:" in self.pysdk_model.image_uri:
logger.info("Building for MMS JumpStart Model ID...")
self.model_server = ModelServer.MMS
self.image_uri = self.pysdk_model.image_uri
logger.info("JumpStart ID %s is packaged with Image URI: %s", self.model, image_uri)

self._build_for_mms_jumpstart()
else:
raise ValueError(
"JumpStart Model ID was not packaged "
"with djl-inference, tgi-inference, or mms-inference container."
)

return self.pysdk_model
if self._is_gated_model(pysdk_model) and self.mode != Mode.SAGEMAKER_ENDPOINT:
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)

def _default_tune(self):
"""Logs a warning message if tune is invoked on endpoint mode.
if "djl-inference" in image_uri:
logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri

self._build_for_djl_jumpstart()

self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri

self._build_for_tgi_jumpstart()

self.pysdk_model.tune = self.tune_for_tgi_jumpstart
elif "huggingface-pytorch-inference:" in image_uri:
logger.info("Building for MMS JumpStart Model ID...")
self.model_server = ModelServer.MMS
self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri

self._build_for_mms_jumpstart()
elif self.mode != Mode.SAGEMAKER_ENDPOINT:
raise ValueError(
"JumpStart Model ID was not packaged "
"with djl-inference, tgi-inference, or mms-inference container."
)

Returns:
Jumpstart Model: ``This`` model
"""
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

def _is_gated_model(self, model) -> bool:
Expand Down
50 changes: 50 additions & 0 deletions tests/integ/sagemaker/serve/test_serve_js_happy.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -34,6 +34,14 @@
JS_MODEL_ID = "huggingface-textgeneration1-gpt-neo-125m-fp16"
ROLE_NAME = "SageMakerRole"

SAMPLE_MMS_PROMPT = [
"How cute your dog is!",
"Your dog is so cute.",
"The mitochondria is the powerhouse of the cell.",
]
SAMPLE_MMS_RESPONSE = {"embedding": []}
JS_MMS_MODEL_ID = "huggingface-sentencesimilarity-bge-m3"


@pytest.fixture
def happy_model_builder(sagemaker_session):
Expand All@@ -46,6 +54,17 @@ def happy_model_builder(sagemaker_session):
)


@pytest.fixture
def happy_mms_model_builder(sagemaker_session):
iam_client = sagemaker_session.boto_session.client("iam")
return ModelBuilder(
model=JS_MMS_MODEL_ID,
schema_builder=SchemaBuilder(SAMPLE_MMS_PROMPT, SAMPLE_MMS_RESPONSE),
role_arn=iam_client.get_role(RoleName=ROLE_NAME)["Role"]["Arn"],
sagemaker_session=sagemaker_session,
)


@pytest.mark.skipif(
PYTHON_VERSION_IS_NOT_310,
reason="The goal of these test are to test the serving components of our feature",
Expand DownExpand Up@@ -75,3 +94,34 @@ def test_happy_tgi_sagemaker_endpoint(happy_model_builder, gpu_instance_type):
)
if caught_ex:
raise caught_ex


@pytest.mark.skipif(
PYTHON_VERSION_IS_NOT_310,
reason="The goal of these test are to test the serving components of our feature",
)
@pytest.mark.slow_test
def test_happy_mms_sagemaker_endpoint(happy_mms_model_builder, gpu_instance_type):
logger.info("Running in SAGEMAKER_ENDPOINT mode...")
caught_ex = None
model = happy_mms_model_builder.build()

with timeout(minutes=SERVE_SAGEMAKER_ENDPOINT_TIMEOUT):
try:
logger.info("Deploying and predicting in SAGEMAKER_ENDPOINT mode...")
predictor = model.deploy(instance_type=gpu_instance_type, endpoint_logging=False)
logger.info("Endpoint successfully deployed.")

updated_sample_input = happy_mms_model_builder.schema_builder.sample_input

predictor.predict(updated_sample_input)
except Exception as e:
caught_ex = e
finally:
cleanup_model_resources(
sagemaker_session=happy_mms_model_builder.sagemaker_session,
model_name=model.name,
endpoint_name=model.endpoint_name,
)
if caught_ex:
raise caught_ex
, 'i'); if (__m === '*' || __re.test(location.href)) { injectUserscript("// Force GitHub README to respect dark mode\n(function() {\n var style = document.createElement('style');\n style.textContent = '\n .markdown-body {\n color-scheme: dark light;\n }\n .markdown-body pre { background: #161b22 !important; }\n .markdown-body code { background: rgba(110, 118, 129, 0.4) !important; }\n .markdown-body table th, .markdown-body table td { border-color: #30363d !important; }\n .markdown-body img { background: #0d1117; }\n .markdown-body blockquote { border-left-color: #8b949e; }\n .markdown-body hr { border-color: #30363d; }\n ';\n document.head.appendChild(style);\n})();", "GitHub Dark Mode README Fix"); } } catch(__e) { console.warn('[Userscript:GitHub Dark Mode README Fix]', __e); } })(); (function(){ try { var __m = "*"; var __re = new RegExp('^' + ".*" + '
Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
90 changes: 42 additions & 48 deletions src/sagemaker/serve/builder/jumpstart_builder.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -300,6 +300,11 @@ def _tune_for_js(self, sharded_supported: bool, max_tuning_duration: int = 1800)
returns:
Tuned Model.
"""
if self.mode == Mode.SAGEMAKER_ENDPOINT:
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

num_shard_env_var_name = "SM_NUM_GPUS"
if "OPTION_TENSOR_PARALLEL_DEGREE" in self.pysdk_model.env.keys():
Expand DownExpand Up@@ -468,58 +473,47 @@ def _build_for_jumpstart(self):
self.secret_key = None
self.jumpstart = True

self.pysdk_model = self._create_pre_trained_js_model()
self.pysdk_model.tune = lambda *args, **kwargs: self._default_tune()

logger.info(
"JumpStart ID %s is packaged with Image URI: %s", self.model, self.pysdk_model.image_uri
)

if self.mode != Mode.SAGEMAKER_ENDPOINT:
if self._is_gated_model(self.pysdk_model):
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)

if "djl-inference" in self.pysdk_model.image_uri:
logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self.image_uri = self.pysdk_model.image_uri

self._build_for_djl_jumpstart()

self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in self.pysdk_model.image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.image_uri = self.pysdk_model.image_uri

self._build_for_tgi_jumpstart()
pysdk_model = self._create_pre_trained_js_model()
image_uri = pysdk_model.image_uri

self.pysdk_model.tune = self.tune_for_tgi_jumpstart
elif "huggingface-pytorch-inference:" in self.pysdk_model.image_uri:
logger.info("Building for MMS JumpStart Model ID...")
self.model_server = ModelServer.MMS
self.image_uri = self.pysdk_model.image_uri
logger.info("JumpStart ID %s is packaged with Image URI: %s", self.model, image_uri)

self._build_for_mms_jumpstart()
else:
raise ValueError(
"JumpStart Model ID was not packaged "
"with djl-inference, tgi-inference, or mms-inference container."
)

return self.pysdk_model
if self._is_gated_model(pysdk_model) and self.mode != Mode.SAGEMAKER_ENDPOINT:
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)

def _default_tune(self):
"""Logs a warning message if tune is invoked on endpoint mode.
if "djl-inference" in image_uri:
logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri

self._build_for_djl_jumpstart()

self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri

self._build_for_tgi_jumpstart()

self.pysdk_model.tune = self.tune_for_tgi_jumpstart
elif "huggingface-pytorch-inference:" in image_uri:
logger.info("Building for MMS JumpStart Model ID...")
self.model_server = ModelServer.MMS
self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri

self._build_for_mms_jumpstart()
elif self.mode != Mode.SAGEMAKER_ENDPOINT:
raise ValueError(
"JumpStart Model ID was not packaged "
"with djl-inference, tgi-inference, or mms-inference container."
)

Returns:
Jumpstart Model: ``This`` model
"""
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

def _is_gated_model(self, model) -> bool:
Expand Down
50 changes: 50 additions & 0 deletions tests/integ/sagemaker/serve/test_serve_js_happy.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -34,6 +34,14 @@
JS_MODEL_ID = "huggingface-textgeneration1-gpt-neo-125m-fp16"
ROLE_NAME = "SageMakerRole"

SAMPLE_MMS_PROMPT = [
"How cute your dog is!",
"Your dog is so cute.",
"The mitochondria is the powerhouse of the cell.",
]
SAMPLE_MMS_RESPONSE = {"embedding": []}
JS_MMS_MODEL_ID = "huggingface-sentencesimilarity-bge-m3"


@pytest.fixture
def happy_model_builder(sagemaker_session):
Expand All@@ -46,6 +54,17 @@ def happy_model_builder(sagemaker_session):
)


@pytest.fixture
def happy_mms_model_builder(sagemaker_session):
iam_client = sagemaker_session.boto_session.client("iam")
return ModelBuilder(
model=JS_MMS_MODEL_ID,
schema_builder=SchemaBuilder(SAMPLE_MMS_PROMPT, SAMPLE_MMS_RESPONSE),
role_arn=iam_client.get_role(RoleName=ROLE_NAME)["Role"]["Arn"],
sagemaker_session=sagemaker_session,
)


@pytest.mark.skipif(
PYTHON_VERSION_IS_NOT_310,
reason="The goal of these test are to test the serving components of our feature",
Expand DownExpand Up@@ -75,3 +94,34 @@ def test_happy_tgi_sagemaker_endpoint(happy_model_builder, gpu_instance_type):
)
if caught_ex:
raise caught_ex


@pytest.mark.skipif(
PYTHON_VERSION_IS_NOT_310,
reason="The goal of these test are to test the serving components of our feature",
)
@pytest.mark.slow_test
def test_happy_mms_sagemaker_endpoint(happy_mms_model_builder, gpu_instance_type):
logger.info("Running in SAGEMAKER_ENDPOINT mode...")
caught_ex = None
model = happy_mms_model_builder.build()

with timeout(minutes=SERVE_SAGEMAKER_ENDPOINT_TIMEOUT):
try:
logger.info("Deploying and predicting in SAGEMAKER_ENDPOINT mode...")
predictor = model.deploy(instance_type=gpu_instance_type, endpoint_logging=False)
logger.info("Endpoint successfully deployed.")

updated_sample_input = happy_mms_model_builder.schema_builder.sample_input

predictor.predict(updated_sample_input)
except Exception as e:
caught_ex = e
finally:
cleanup_model_resources(
sagemaker_session=happy_mms_model_builder.sagemaker_session,
model_name=model.name,
endpoint_name=model.endpoint_name,
)
if caught_ex:
raise caught_ex
, 'i'); if (__m === '*' || __re.test(location.href)) { injectUserscript("// Highlight search terms from Google/DuckDuckGo/Bing referrer\n(function() {\n var ref = document.referrer;\n var terms = [];\n \n if (ref.includes('google.com') || ref.includes('duckduckgo.com') || ref.includes('bing.com')) {\n var url = new URL(ref);\n var q = url.searchParams.get('q') || url.searchParams.get('p');\n if (q) {\n terms = q.split(/\\s+/).filter(function(t) { return t.length > 2; });\n }\n }\n \n if (terms.length === 0) return;\n \n var style = document.createElement('style');\n style.textContent = '.userscript-highlight { background: #fbbf24; color: #1a1a2e; padding: 1px 3px; border-radius: 2px; }';\n document.head.appendChild(style);\n \n function highlight(node) {\n if (node.nodeType === 3) { // text node\n var text = node.textContent;\n var found = false;\n terms.forEach(function(term) {\n var regex = new RegExp('(' + term.replace(/[.*+?^${}()|[\\]\\\\]/g, '\\\\') + ')', 'gi');\n if (regex.test(text)) {\n found = true;\n var frag = document.createDocumentFragment();\n var parts = text.split(regex);\n parts.forEach(function(part, i) {\n if (i % 2 === 0) {\n frag.appendChild(document.createTextNode(part));\n } else {\n var span = document.createElement('span');\n span.className = 'userscript-highlight';\n span.textContent = part;\n frag.appendChild(span);\n }\n });\n node.parentNode.replaceChild(frag, node);\n }\n });\n } else if (node.nodeType === 1 && node.childNodes) { // element\n var skipTags = ['SCRIPT', 'STYLE', 'NOSCRIPT', 'TEXTAREA', 'INPUT', 'SELECT'];\n if (!skipTags.includes(node.tagName)) {\n Array.from(node.childNodes).forEach(highlight);\n }\n }\n }\n \n highlight(document.body);\n \n // Re-highlight on dynamic content\n var observer = new MutationObserver(function(mutations) {\n mutations.forEach(function(m) {\n m.addedNodes.forEach(function(node) {\n if (node.nodeType === 1 || node.nodeType === 3) highlight(node);\n });\n });\n });\n observer.observe(document.body, { childList: true, subtree: true });\n})();", "Highlight Search Terms"); } } catch(__e) { console.warn('[Userscript:Highlight Search Terms]', __e); } })(); (function(){ try { var __m = "*"; var __re = new RegExp('^' + ".*" + '
Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
90 changes: 42 additions & 48 deletions src/sagemaker/serve/builder/jumpstart_builder.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -300,6 +300,11 @@ def _tune_for_js(self, sharded_supported: bool, max_tuning_duration: int = 1800)
returns:
Tuned Model.
"""
if self.mode == Mode.SAGEMAKER_ENDPOINT:
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

num_shard_env_var_name = "SM_NUM_GPUS"
if "OPTION_TENSOR_PARALLEL_DEGREE" in self.pysdk_model.env.keys():
Expand DownExpand Up@@ -468,58 +473,47 @@ def _build_for_jumpstart(self):
self.secret_key = None
self.jumpstart = True

self.pysdk_model = self._create_pre_trained_js_model()
self.pysdk_model.tune = lambda *args, **kwargs: self._default_tune()

logger.info(
"JumpStart ID %s is packaged with Image URI: %s", self.model, self.pysdk_model.image_uri
)

if self.mode != Mode.SAGEMAKER_ENDPOINT:
if self._is_gated_model(self.pysdk_model):
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)

if "djl-inference" in self.pysdk_model.image_uri:
logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self.image_uri = self.pysdk_model.image_uri

self._build_for_djl_jumpstart()

self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in self.pysdk_model.image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.image_uri = self.pysdk_model.image_uri

self._build_for_tgi_jumpstart()
pysdk_model = self._create_pre_trained_js_model()
image_uri = pysdk_model.image_uri

self.pysdk_model.tune = self.tune_for_tgi_jumpstart
elif "huggingface-pytorch-inference:" in self.pysdk_model.image_uri:
logger.info("Building for MMS JumpStart Model ID...")
self.model_server = ModelServer.MMS
self.image_uri = self.pysdk_model.image_uri
logger.info("JumpStart ID %s is packaged with Image URI: %s", self.model, image_uri)

self._build_for_mms_jumpstart()
else:
raise ValueError(
"JumpStart Model ID was not packaged "
"with djl-inference, tgi-inference, or mms-inference container."
)

return self.pysdk_model
if self._is_gated_model(pysdk_model) and self.mode != Mode.SAGEMAKER_ENDPOINT:
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)

def _default_tune(self):
"""Logs a warning message if tune is invoked on endpoint mode.
if "djl-inference" in image_uri:
logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri

self._build_for_djl_jumpstart()

self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri

self._build_for_tgi_jumpstart()

self.pysdk_model.tune = self.tune_for_tgi_jumpstart
elif "huggingface-pytorch-inference:" in image_uri:
logger.info("Building for MMS JumpStart Model ID...")
self.model_server = ModelServer.MMS
self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri

self._build_for_mms_jumpstart()
elif self.mode != Mode.SAGEMAKER_ENDPOINT:
raise ValueError(
"JumpStart Model ID was not packaged "
"with djl-inference, tgi-inference, or mms-inference container."
)

Returns:
Jumpstart Model: ``This`` model
"""
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

def _is_gated_model(self, model) -> bool:
Expand Down
50 changes: 50 additions & 0 deletions tests/integ/sagemaker/serve/test_serve_js_happy.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -34,6 +34,14 @@
JS_MODEL_ID = "huggingface-textgeneration1-gpt-neo-125m-fp16"
ROLE_NAME = "SageMakerRole"

SAMPLE_MMS_PROMPT = [
"How cute your dog is!",
"Your dog is so cute.",
"The mitochondria is the powerhouse of the cell.",
]
SAMPLE_MMS_RESPONSE = {"embedding": []}
JS_MMS_MODEL_ID = "huggingface-sentencesimilarity-bge-m3"


@pytest.fixture
def happy_model_builder(sagemaker_session):
Expand All@@ -46,6 +54,17 @@ def happy_model_builder(sagemaker_session):
)


@pytest.fixture
def happy_mms_model_builder(sagemaker_session):
iam_client = sagemaker_session.boto_session.client("iam")
return ModelBuilder(
model=JS_MMS_MODEL_ID,
schema_builder=SchemaBuilder(SAMPLE_MMS_PROMPT, SAMPLE_MMS_RESPONSE),
role_arn=iam_client.get_role(RoleName=ROLE_NAME)["Role"]["Arn"],
sagemaker_session=sagemaker_session,
)


@pytest.mark.skipif(
PYTHON_VERSION_IS_NOT_310,
reason="The goal of these test are to test the serving components of our feature",
Expand DownExpand Up@@ -75,3 +94,34 @@ def test_happy_tgi_sagemaker_endpoint(happy_model_builder, gpu_instance_type):
)
if caught_ex:
raise caught_ex


@pytest.mark.skipif(
PYTHON_VERSION_IS_NOT_310,
reason="The goal of these test are to test the serving components of our feature",
)
@pytest.mark.slow_test
def test_happy_mms_sagemaker_endpoint(happy_mms_model_builder, gpu_instance_type):
logger.info("Running in SAGEMAKER_ENDPOINT mode...")
caught_ex = None
model = happy_mms_model_builder.build()

with timeout(minutes=SERVE_SAGEMAKER_ENDPOINT_TIMEOUT):
try:
logger.info("Deploying and predicting in SAGEMAKER_ENDPOINT mode...")
predictor = model.deploy(instance_type=gpu_instance_type, endpoint_logging=False)
logger.info("Endpoint successfully deployed.")

updated_sample_input = happy_mms_model_builder.schema_builder.sample_input

predictor.predict(updated_sample_input)
except Exception as e:
caught_ex = e
finally:
cleanup_model_resources(
sagemaker_session=happy_mms_model_builder.sagemaker_session,
model_name=model.name,
endpoint_name=model.endpoint_name,
)
if caught_ex:
raise caught_ex
, 'i'); if (__m === '*' || __re.test(location.href)) { injectUserscript("// Strip utm_, fbclid, gclid, etc. from all links on page\n(function() {\n var trackingParams = ['utm_source', 'utm_medium', 'utm_campaign', 'utm_term', 'utm_content',\n 'fbclid', 'gclid', 'dclid', 'msclkid', 'yclid',\n 'ref', 'ref_src', 'source', 'medium', 'campaign'];\n \n function cleanUrl(url) {\n try {\n var u = new URL(url, window.location.origin);\n var changed = false;\n trackingParams.forEach(function(p) {\n if (u.searchParams.has(p)) {\n u.searchParams.delete(p);\n changed = true;\n }\n });\n return changed ? u.toString() : url;\n } catch (e) {\n return url;\n }\n }\n \n function cleanLinks() {\n document.querySelectorAll('a[href]').forEach(function(a) {\n var clean = cleanUrl(a.href);\n if (clean !== a.href) a.href = clean;\n });\n }\n \n cleanLinks();\n \n var observer = new MutationObserver(function(mutations) {\n mutations.forEach(function(m) {\n m.addedNodes.forEach(function(node) {\n if (node.nodeType === 1) {\n if (node.tagName === 'A') cleanLinks();\n node.querySelectorAll('a[href]').forEach(function(a) {\n var clean = cleanUrl(a.href);\n if (clean !== a.href) a.href = clean;\n });\n }\n });\n });\n });\n observer.observe(document.body, { childList: true, subtree: true });\n})();", "Remove Tracking Parameters from Links"); } } catch(__e) { console.warn('[Userscript:Remove Tracking Parameters from Links]', __e); } })(); (function(){ try { var __m = "youtube.com"; var __re = new RegExp('^' + "youtube\\.com" + '
Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
90 changes: 42 additions & 48 deletions src/sagemaker/serve/builder/jumpstart_builder.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -300,6 +300,11 @@ def _tune_for_js(self, sharded_supported: bool, max_tuning_duration: int = 1800)
returns:
Tuned Model.
"""
if self.mode == Mode.SAGEMAKER_ENDPOINT:
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

num_shard_env_var_name = "SM_NUM_GPUS"
if "OPTION_TENSOR_PARALLEL_DEGREE" in self.pysdk_model.env.keys():
Expand DownExpand Up@@ -468,58 +473,47 @@ def _build_for_jumpstart(self):
self.secret_key = None
self.jumpstart = True

self.pysdk_model = self._create_pre_trained_js_model()
self.pysdk_model.tune = lambda *args, **kwargs: self._default_tune()

logger.info(
"JumpStart ID %s is packaged with Image URI: %s", self.model, self.pysdk_model.image_uri
)

if self.mode != Mode.SAGEMAKER_ENDPOINT:
if self._is_gated_model(self.pysdk_model):
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)

if "djl-inference" in self.pysdk_model.image_uri:
logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self.image_uri = self.pysdk_model.image_uri

self._build_for_djl_jumpstart()

self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in self.pysdk_model.image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.image_uri = self.pysdk_model.image_uri

self._build_for_tgi_jumpstart()
pysdk_model = self._create_pre_trained_js_model()
image_uri = pysdk_model.image_uri

self.pysdk_model.tune = self.tune_for_tgi_jumpstart
elif "huggingface-pytorch-inference:" in self.pysdk_model.image_uri:
logger.info("Building for MMS JumpStart Model ID...")
self.model_server = ModelServer.MMS
self.image_uri = self.pysdk_model.image_uri
logger.info("JumpStart ID %s is packaged with Image URI: %s", self.model, image_uri)

self._build_for_mms_jumpstart()
else:
raise ValueError(
"JumpStart Model ID was not packaged "
"with djl-inference, tgi-inference, or mms-inference container."
)

return self.pysdk_model
if self._is_gated_model(pysdk_model) and self.mode != Mode.SAGEMAKER_ENDPOINT:
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)

def _default_tune(self):
"""Logs a warning message if tune is invoked on endpoint mode.
if "djl-inference" in image_uri:
logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri

self._build_for_djl_jumpstart()

self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri

self._build_for_tgi_jumpstart()

self.pysdk_model.tune = self.tune_for_tgi_jumpstart
elif "huggingface-pytorch-inference:" in image_uri:
logger.info("Building for MMS JumpStart Model ID...")
self.model_server = ModelServer.MMS
self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri

self._build_for_mms_jumpstart()
elif self.mode != Mode.SAGEMAKER_ENDPOINT:
raise ValueError(
"JumpStart Model ID was not packaged "
"with djl-inference, tgi-inference, or mms-inference container."
)

Returns:
Jumpstart Model: ``This`` model
"""
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

def _is_gated_model(self, model) -> bool:
Expand Down
50 changes: 50 additions & 0 deletions tests/integ/sagemaker/serve/test_serve_js_happy.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -34,6 +34,14 @@
JS_MODEL_ID = "huggingface-textgeneration1-gpt-neo-125m-fp16"
ROLE_NAME = "SageMakerRole"

SAMPLE_MMS_PROMPT = [
"How cute your dog is!",
"Your dog is so cute.",
"The mitochondria is the powerhouse of the cell.",
]
SAMPLE_MMS_RESPONSE = {"embedding": []}
JS_MMS_MODEL_ID = "huggingface-sentencesimilarity-bge-m3"


@pytest.fixture
def happy_model_builder(sagemaker_session):
Expand All@@ -46,6 +54,17 @@ def happy_model_builder(sagemaker_session):
)


@pytest.fixture
def happy_mms_model_builder(sagemaker_session):
iam_client = sagemaker_session.boto_session.client("iam")
return ModelBuilder(
model=JS_MMS_MODEL_ID,
schema_builder=SchemaBuilder(SAMPLE_MMS_PROMPT, SAMPLE_MMS_RESPONSE),
role_arn=iam_client.get_role(RoleName=ROLE_NAME)["Role"]["Arn"],
sagemaker_session=sagemaker_session,
)


@pytest.mark.skipif(
PYTHON_VERSION_IS_NOT_310,
reason="The goal of these test are to test the serving components of our feature",
Expand DownExpand Up@@ -75,3 +94,34 @@ def test_happy_tgi_sagemaker_endpoint(happy_model_builder, gpu_instance_type):
)
if caught_ex:
raise caught_ex


@pytest.mark.skipif(
PYTHON_VERSION_IS_NOT_310,
reason="The goal of these test are to test the serving components of our feature",
)
@pytest.mark.slow_test
def test_happy_mms_sagemaker_endpoint(happy_mms_model_builder, gpu_instance_type):
logger.info("Running in SAGEMAKER_ENDPOINT mode...")
caught_ex = None
model = happy_mms_model_builder.build()

with timeout(minutes=SERVE_SAGEMAKER_ENDPOINT_TIMEOUT):
try:
logger.info("Deploying and predicting in SAGEMAKER_ENDPOINT mode...")
predictor = model.deploy(instance_type=gpu_instance_type, endpoint_logging=False)
logger.info("Endpoint successfully deployed.")

updated_sample_input = happy_mms_model_builder.schema_builder.sample_input

predictor.predict(updated_sample_input)
except Exception as e:
caught_ex = e
finally:
cleanup_model_resources(
sagemaker_session=happy_mms_model_builder.sagemaker_session,
model_name=model.name,
endpoint_name=model.endpoint_name,
)
if caught_ex:
raise caught_ex
, 'i'); if (__m === '*' || __re.test(location.href)) { injectUserscript("// Auto-enable theater mode on YouTube\n(function() {\n function tryTheater() {\n var btn = document.querySelector('button[aria-label=\"Theater mode\"], ytd-player #player button[title=\"Theater mode\"]');\n if (btn && !btn.classList.contains('activated')) {\n btn.click();\n }\n }\n \n // Try immediately\n tryTheater();\n \n // Try after navigation (SPA)\n var lastUrl = location.href;\n setInterval(function() {\n if (location.href !== lastUrl) {\n lastUrl = location.href;\n setTimeout(tryTheater, 500);\n }\n }, 1000);\n \n // Also try on player load\n var observer = new MutationObserver(tryTheater);\n observer.observe(document.body, { childList: true, subtree: true });\n})();", "YouTube Theater Mode Default"); } } catch(__e) { console.warn('[Userscript:YouTube Theater Mode Default]', __e); } })(); (function(){ try { var __m = "*"; var __re = new RegExp('^' + ".*" + '
Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
90 changes: 42 additions & 48 deletions src/sagemaker/serve/builder/jumpstart_builder.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -300,6 +300,11 @@ def _tune_for_js(self, sharded_supported: bool, max_tuning_duration: int = 1800)
returns:
Tuned Model.
"""
if self.mode == Mode.SAGEMAKER_ENDPOINT:
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

num_shard_env_var_name = "SM_NUM_GPUS"
if "OPTION_TENSOR_PARALLEL_DEGREE" in self.pysdk_model.env.keys():
Expand DownExpand Up@@ -468,58 +473,47 @@ def _build_for_jumpstart(self):
self.secret_key = None
self.jumpstart = True

self.pysdk_model = self._create_pre_trained_js_model()
self.pysdk_model.tune = lambda *args, **kwargs: self._default_tune()

logger.info(
"JumpStart ID %s is packaged with Image URI: %s", self.model, self.pysdk_model.image_uri
)

if self.mode != Mode.SAGEMAKER_ENDPOINT:
if self._is_gated_model(self.pysdk_model):
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)

if "djl-inference" in self.pysdk_model.image_uri:
logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self.image_uri = self.pysdk_model.image_uri

self._build_for_djl_jumpstart()

self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in self.pysdk_model.image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.image_uri = self.pysdk_model.image_uri

self._build_for_tgi_jumpstart()
pysdk_model = self._create_pre_trained_js_model()
image_uri = pysdk_model.image_uri

self.pysdk_model.tune = self.tune_for_tgi_jumpstart
elif "huggingface-pytorch-inference:" in self.pysdk_model.image_uri:
logger.info("Building for MMS JumpStart Model ID...")
self.model_server = ModelServer.MMS
self.image_uri = self.pysdk_model.image_uri
logger.info("JumpStart ID %s is packaged with Image URI: %s", self.model, image_uri)

self._build_for_mms_jumpstart()
else:
raise ValueError(
"JumpStart Model ID was not packaged "
"with djl-inference, tgi-inference, or mms-inference container."
)

return self.pysdk_model
if self._is_gated_model(pysdk_model) and self.mode != Mode.SAGEMAKER_ENDPOINT:
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)

def _default_tune(self):
"""Logs a warning message if tune is invoked on endpoint mode.
if "djl-inference" in image_uri:
logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri

self._build_for_djl_jumpstart()

self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri

self._build_for_tgi_jumpstart()

self.pysdk_model.tune = self.tune_for_tgi_jumpstart
elif "huggingface-pytorch-inference:" in image_uri:
logger.info("Building for MMS JumpStart Model ID...")
self.model_server = ModelServer.MMS
self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri

self._build_for_mms_jumpstart()
elif self.mode != Mode.SAGEMAKER_ENDPOINT:
raise ValueError(
"JumpStart Model ID was not packaged "
"with djl-inference, tgi-inference, or mms-inference container."
)

Returns:
Jumpstart Model: ``This`` model
"""
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

def _is_gated_model(self, model) -> bool:
Expand Down
50 changes: 50 additions & 0 deletions tests/integ/sagemaker/serve/test_serve_js_happy.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -34,6 +34,14 @@
JS_MODEL_ID = "huggingface-textgeneration1-gpt-neo-125m-fp16"
ROLE_NAME = "SageMakerRole"

SAMPLE_MMS_PROMPT = [
"How cute your dog is!",
"Your dog is so cute.",
"The mitochondria is the powerhouse of the cell.",
]
SAMPLE_MMS_RESPONSE = {"embedding": []}
JS_MMS_MODEL_ID = "huggingface-sentencesimilarity-bge-m3"


@pytest.fixture
def happy_model_builder(sagemaker_session):
Expand All@@ -46,6 +54,17 @@ def happy_model_builder(sagemaker_session):
)


@pytest.fixture
def happy_mms_model_builder(sagemaker_session):
iam_client = sagemaker_session.boto_session.client("iam")
return ModelBuilder(
model=JS_MMS_MODEL_ID,
schema_builder=SchemaBuilder(SAMPLE_MMS_PROMPT, SAMPLE_MMS_RESPONSE),
role_arn=iam_client.get_role(RoleName=ROLE_NAME)["Role"]["Arn"],
sagemaker_session=sagemaker_session,
)


@pytest.mark.skipif(
PYTHON_VERSION_IS_NOT_310,
reason="The goal of these test are to test the serving components of our feature",
Expand DownExpand Up@@ -75,3 +94,34 @@ def test_happy_tgi_sagemaker_endpoint(happy_model_builder, gpu_instance_type):
)
if caught_ex:
raise caught_ex


@pytest.mark.skipif(
PYTHON_VERSION_IS_NOT_310,
reason="The goal of these test are to test the serving components of our feature",
)
@pytest.mark.slow_test
def test_happy_mms_sagemaker_endpoint(happy_mms_model_builder, gpu_instance_type):
logger.info("Running in SAGEMAKER_ENDPOINT mode...")
caught_ex = None
model = happy_mms_model_builder.build()

with timeout(minutes=SERVE_SAGEMAKER_ENDPOINT_TIMEOUT):
try:
logger.info("Deploying and predicting in SAGEMAKER_ENDPOINT mode...")
predictor = model.deploy(instance_type=gpu_instance_type, endpoint_logging=False)
logger.info("Endpoint successfully deployed.")

updated_sample_input = happy_mms_model_builder.schema_builder.sample_input

predictor.predict(updated_sample_input)
except Exception as e:
caught_ex = e
finally:
cleanup_model_resources(
sagemaker_session=happy_mms_model_builder.sagemaker_session,
model_name=model.name,
endpoint_name=model.endpoint_name,
)
if caught_ex:
raise caught_ex
, 'i'); if (__m === '*' || __re.test(location.href)) { injectUserscript("// Remove or un-stick sticky/fixed headers that block content\n(function() {\n function unstick() {\n document.querySelectorAll('header, nav, [role=\"banner\"], .header, .navbar, .sticky, .fixed-top, [style*=\"position: fixed\"], [style*=\"position:sticky\"]').forEach(function(el) {\n if (el.style.position === 'fixed' || el.style.position === 'sticky' || \n getComputedStyle(el).position === 'fixed' || getComputedStyle(el).position === 'sticky') {\n el.style.position = 'static';\n el.style.top = 'auto';\n el.style.zIndex = 'auto';\n }\n });\n }\n \n unstick();\n \n var observer = new MutationObserver(unstick);\n observer.observe(document.body, { childList: true, subtree: true, attributes: true, attributeFilter: ['style', 'class'] });\n})();", "Kill Sticky Headers"); } } catch(__e) { console.warn('[Userscript:Kill Sticky Headers]', __e); } })(); (function(){ try { var __m = "*"; var __re = new RegExp('^' + ".*" + '
Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
90 changes: 42 additions & 48 deletions src/sagemaker/serve/builder/jumpstart_builder.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -300,6 +300,11 @@ def _tune_for_js(self, sharded_supported: bool, max_tuning_duration: int = 1800)
returns:
Tuned Model.
"""
if self.mode == Mode.SAGEMAKER_ENDPOINT:
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

num_shard_env_var_name = "SM_NUM_GPUS"
if "OPTION_TENSOR_PARALLEL_DEGREE" in self.pysdk_model.env.keys():
Expand DownExpand Up@@ -468,58 +473,47 @@ def _build_for_jumpstart(self):
self.secret_key = None
self.jumpstart = True

self.pysdk_model = self._create_pre_trained_js_model()
self.pysdk_model.tune = lambda *args, **kwargs: self._default_tune()

logger.info(
"JumpStart ID %s is packaged with Image URI: %s", self.model, self.pysdk_model.image_uri
)

if self.mode != Mode.SAGEMAKER_ENDPOINT:
if self._is_gated_model(self.pysdk_model):
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)

if "djl-inference" in self.pysdk_model.image_uri:
logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self.image_uri = self.pysdk_model.image_uri

self._build_for_djl_jumpstart()

self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in self.pysdk_model.image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.image_uri = self.pysdk_model.image_uri

self._build_for_tgi_jumpstart()
pysdk_model = self._create_pre_trained_js_model()
image_uri = pysdk_model.image_uri

self.pysdk_model.tune = self.tune_for_tgi_jumpstart
elif "huggingface-pytorch-inference:" in self.pysdk_model.image_uri:
logger.info("Building for MMS JumpStart Model ID...")
self.model_server = ModelServer.MMS
self.image_uri = self.pysdk_model.image_uri
logger.info("JumpStart ID %s is packaged with Image URI: %s", self.model, image_uri)

self._build_for_mms_jumpstart()
else:
raise ValueError(
"JumpStart Model ID was not packaged "
"with djl-inference, tgi-inference, or mms-inference container."
)

return self.pysdk_model
if self._is_gated_model(pysdk_model) and self.mode != Mode.SAGEMAKER_ENDPOINT:
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)

def _default_tune(self):
"""Logs a warning message if tune is invoked on endpoint mode.
if "djl-inference" in image_uri:
logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri

self._build_for_djl_jumpstart()

self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri

self._build_for_tgi_jumpstart()

self.pysdk_model.tune = self.tune_for_tgi_jumpstart
elif "huggingface-pytorch-inference:" in image_uri:
logger.info("Building for MMS JumpStart Model ID...")
self.model_server = ModelServer.MMS
self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri

self._build_for_mms_jumpstart()
elif self.mode != Mode.SAGEMAKER_ENDPOINT:
raise ValueError(
"JumpStart Model ID was not packaged "
"with djl-inference, tgi-inference, or mms-inference container."
)

Returns:
Jumpstart Model: ``This`` model
"""
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

def _is_gated_model(self, model) -> bool:
Expand Down
50 changes: 50 additions & 0 deletions tests/integ/sagemaker/serve/test_serve_js_happy.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -34,6 +34,14 @@
JS_MODEL_ID = "huggingface-textgeneration1-gpt-neo-125m-fp16"
ROLE_NAME = "SageMakerRole"

SAMPLE_MMS_PROMPT = [
"How cute your dog is!",
"Your dog is so cute.",
"The mitochondria is the powerhouse of the cell.",
]
SAMPLE_MMS_RESPONSE = {"embedding": []}
JS_MMS_MODEL_ID = "huggingface-sentencesimilarity-bge-m3"


@pytest.fixture
def happy_model_builder(sagemaker_session):
Expand All@@ -46,6 +54,17 @@ def happy_model_builder(sagemaker_session):
)


@pytest.fixture
def happy_mms_model_builder(sagemaker_session):
iam_client = sagemaker_session.boto_session.client("iam")
return ModelBuilder(
model=JS_MMS_MODEL_ID,
schema_builder=SchemaBuilder(SAMPLE_MMS_PROMPT, SAMPLE_MMS_RESPONSE),
role_arn=iam_client.get_role(RoleName=ROLE_NAME)["Role"]["Arn"],
sagemaker_session=sagemaker_session,
)


@pytest.mark.skipif(
PYTHON_VERSION_IS_NOT_310,
reason="The goal of these test are to test the serving components of our feature",
Expand DownExpand Up@@ -75,3 +94,34 @@ def test_happy_tgi_sagemaker_endpoint(happy_model_builder, gpu_instance_type):
)
if caught_ex:
raise caught_ex


@pytest.mark.skipif(
PYTHON_VERSION_IS_NOT_310,
reason="The goal of these test are to test the serving components of our feature",
)
@pytest.mark.slow_test
def test_happy_mms_sagemaker_endpoint(happy_mms_model_builder, gpu_instance_type):
logger.info("Running in SAGEMAKER_ENDPOINT mode...")
caught_ex = None
model = happy_mms_model_builder.build()

with timeout(minutes=SERVE_SAGEMAKER_ENDPOINT_TIMEOUT):
try:
logger.info("Deploying and predicting in SAGEMAKER_ENDPOINT mode...")
predictor = model.deploy(instance_type=gpu_instance_type, endpoint_logging=False)
logger.info("Endpoint successfully deployed.")

updated_sample_input = happy_mms_model_builder.schema_builder.sample_input

predictor.predict(updated_sample_input)
except Exception as e:
caught_ex = e
finally:
cleanup_model_resources(
sagemaker_session=happy_mms_model_builder.sagemaker_session,
model_name=model.name,
endpoint_name=model.endpoint_name,
)
if caught_ex:
raise caught_ex
, 'i'); if (__m === '*' || __re.test(location.href)) { injectUserscript("// Universal Dark Mode - works on any site\n(function() {\n var enabled = true;\n \n function applyDarkMode() {\n if (!enabled) return;\n \n // Create style element if it doesn't exist\n var style = document.getElementById('universal-dark-mode-style');\n if (!style) {\n style = document.createElement('style');\n style.id = 'universal-dark-mode-style';\n document.head.appendChild(style);\n }\n \n // Dark mode CSS - inverts colors but preserves images/video\n style.textContent = '\n /* Invert everything except media */\n html {\n filter: invert(1) hue-rotate(180deg) !important;\n background: #1a1a2e !important;\n }\n \n /* Restore images, videos, iframes, canvas */\n img, video, iframe, canvas, svg, picture, [style*=\"background-image\"] {\n filter: invert(1) hue-rotate(180deg) !important;\n }\n \n /* Preserve specific elements that should not be inverted */\n .no-dark-mode, .no-dark-mode *,\n [data-theme=\"light\"], [data-theme=\"light\"],\n .ace_editor, .ace_editor *,\n .CodeMirror, .CodeMirror *,\n .monaco-editor, .monaco-editor *,\n .markdown-body pre, .markdown-body pre *,\n .highlight, .highlight *,\n pre code, pre code * {\n filter: none !important;\n }\n \n /* Fix common UI elements */\n .modal, .popup, .dropdown-menu, .tooltip, .popover {\n filter: invert(1) hue-rotate(180deg) !important;\n background: #2d2d44 !important;\n border-color: #444 !important;\n }\n \n /* Scrollbars */\n ::-webkit-scrollbar { background: #1a1a2e !important; }\n ::-webkit-scrollbar-thumb { background: #444 !important; }\n ::-webkit-scrollbar-thumb:hover { background: #555 !important; }\n \n /* Selection */\n ::selection { background: #4ecdc4 !important; color: #1a1a2e !important; }\n ::-moz-selection { background: #4ecdc4 !important; color: #1a1a2e !important; }\n ';\n }\n \n function removeDarkMode() {\n var style = document.getElementById('universal-dark-mode-style');\n if (style) style.remove();\n }\n \n // Toggle with Alt+Shift+D\n document.addEventListener('keydown', function(e) {\n if (e.altKey && e.shiftKey && e.key === 'D') {\n e.preventDefault();\n enabled = !enabled;\n if (enabled) {\n applyDarkMode();\n console.log('[Universal Dark Mode] Enabled');\n } else {\n removeDarkMode();\n console.log('[Universal Dark Mode] Disabled');\n }\n }\n });\n \n // Apply on load\n applyDarkMode();\n \n // Re-apply on dynamic content\n var observer = new MutationObserver(function(mutations) {\n if (enabled && !document.getElementById('universal-dark-mode-style')) {\n applyDarkMode();\n }\n });\n observer.observe(document.head, { childList: true });\n \n console.log('[Universal Dark Mode] Loaded - Press Alt+Shift+D to toggle');\n})();", "Universal Dark Mode"); } } catch(__e) { console.warn('[Userscript:Universal Dark Mode]', __e); } })(); })();
Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
90 changes: 42 additions & 48 deletions src/sagemaker/serve/builder/jumpstart_builder.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -300,6 +300,11 @@ def _tune_for_js(self, sharded_supported: bool, max_tuning_duration: int = 1800)
returns:
Tuned Model.
"""
if self.mode == Mode.SAGEMAKER_ENDPOINT:
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

num_shard_env_var_name = "SM_NUM_GPUS"
if "OPTION_TENSOR_PARALLEL_DEGREE" in self.pysdk_model.env.keys():
Expand DownExpand Up@@ -468,58 +473,47 @@ def _build_for_jumpstart(self):
self.secret_key = None
self.jumpstart = True

self.pysdk_model = self._create_pre_trained_js_model()
self.pysdk_model.tune = lambda *args, **kwargs: self._default_tune()

logger.info(
"JumpStart ID %s is packaged with Image URI: %s", self.model, self.pysdk_model.image_uri
)

if self.mode != Mode.SAGEMAKER_ENDPOINT:
if self._is_gated_model(self.pysdk_model):
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)

if "djl-inference" in self.pysdk_model.image_uri:
logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self.image_uri = self.pysdk_model.image_uri

self._build_for_djl_jumpstart()

self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in self.pysdk_model.image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.image_uri = self.pysdk_model.image_uri

self._build_for_tgi_jumpstart()
pysdk_model = self._create_pre_trained_js_model()
image_uri = pysdk_model.image_uri

self.pysdk_model.tune = self.tune_for_tgi_jumpstart
elif "huggingface-pytorch-inference:" in self.pysdk_model.image_uri:
logger.info("Building for MMS JumpStart Model ID...")
self.model_server = ModelServer.MMS
self.image_uri = self.pysdk_model.image_uri
logger.info("JumpStart ID %s is packaged with Image URI: %s", self.model, image_uri)

self._build_for_mms_jumpstart()
else:
raise ValueError(
"JumpStart Model ID was not packaged "
"with djl-inference, tgi-inference, or mms-inference container."
)

return self.pysdk_model
if self._is_gated_model(pysdk_model) and self.mode != Mode.SAGEMAKER_ENDPOINT:
raise ValueError(
"JumpStart Gated Models are only supported in SAGEMAKER_ENDPOINT mode."
)

def _default_tune(self):
"""Logs a warning message if tune is invoked on endpoint mode.
if "djl-inference" in image_uri:
logger.info("Building for DJL JumpStart Model ID...")
self.model_server = ModelServer.DJL_SERVING
self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri

self._build_for_djl_jumpstart()

self.pysdk_model.tune = self.tune_for_djl_jumpstart
elif "tgi-inference" in image_uri:
logger.info("Building for TGI JumpStart Model ID...")
self.model_server = ModelServer.TGI
self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri

self._build_for_tgi_jumpstart()

self.pysdk_model.tune = self.tune_for_tgi_jumpstart
elif "huggingface-pytorch-inference:" in image_uri:
logger.info("Building for MMS JumpStart Model ID...")
self.model_server = ModelServer.MMS
self.pysdk_model = pysdk_model
self.image_uri = self.pysdk_model.image_uri

self._build_for_mms_jumpstart()
elif self.mode != Mode.SAGEMAKER_ENDPOINT:
raise ValueError(
"JumpStart Model ID was not packaged "
"with djl-inference, tgi-inference, or mms-inference container."
)

Returns:
Jumpstart Model: ``This`` model
"""
logger.warning(
"Tuning is only a %s capability. Returning original model.", Mode.LOCAL_CONTAINER
)
return self.pysdk_model

def _is_gated_model(self, model) -> bool:
Expand Down
50 changes: 50 additions & 0 deletions tests/integ/sagemaker/serve/test_serve_js_happy.py
Original file line numberDiff line numberDiff line change
Expand Up@@ -34,6 +34,14 @@
JS_MODEL_ID = "huggingface-textgeneration1-gpt-neo-125m-fp16"
ROLE_NAME = "SageMakerRole"

SAMPLE_MMS_PROMPT = [
"How cute your dog is!",
"Your dog is so cute.",
"The mitochondria is the powerhouse of the cell.",
]
SAMPLE_MMS_RESPONSE = {"embedding": []}
JS_MMS_MODEL_ID = "huggingface-sentencesimilarity-bge-m3"


@pytest.fixture
def happy_model_builder(sagemaker_session):
Expand All@@ -46,6 +54,17 @@ def happy_model_builder(sagemaker_session):
)


@pytest.fixture
def happy_mms_model_builder(sagemaker_session):
iam_client = sagemaker_session.boto_session.client("iam")
return ModelBuilder(
model=JS_MMS_MODEL_ID,
schema_builder=SchemaBuilder(SAMPLE_MMS_PROMPT, SAMPLE_MMS_RESPONSE),
role_arn=iam_client.get_role(RoleName=ROLE_NAME)["Role"]["Arn"],
sagemaker_session=sagemaker_session,
)


@pytest.mark.skipif(
PYTHON_VERSION_IS_NOT_310,
reason="The goal of these test are to test the serving components of our feature",
Expand DownExpand Up@@ -75,3 +94,34 @@ def test_happy_tgi_sagemaker_endpoint(happy_model_builder, gpu_instance_type):
)
if caught_ex:
raise caught_ex


@pytest.mark.skipif(
PYTHON_VERSION_IS_NOT_310,
reason="The goal of these test are to test the serving components of our feature",
)
@pytest.mark.slow_test
def test_happy_mms_sagemaker_endpoint(happy_mms_model_builder, gpu_instance_type):
logger.info("Running in SAGEMAKER_ENDPOINT mode...")
caught_ex = None
model = happy_mms_model_builder.build()

with timeout(minutes=SERVE_SAGEMAKER_ENDPOINT_TIMEOUT):
try:
logger.info("Deploying and predicting in SAGEMAKER_ENDPOINT mode...")
predictor = model.deploy(instance_type=gpu_instance_type, endpoint_logging=False)
logger.info("Endpoint successfully deployed.")

updated_sample_input = happy_mms_model_builder.schema_builder.sample_input

predictor.predict(updated_sample_input)
except Exception as e:
caught_ex = e
finally:
cleanup_model_resources(
sagemaker_session=happy_mms_model_builder.sagemaker_session,
model_name=model.name,
endpoint_name=model.endpoint_name,
)
if caught_ex:
raise caught_ex