AWS는 9월 8일 Amazon Bedrock AgentCore 평가를 GitHub Actions에 연결하는 참조 구현을 공개했습니다. OAuth로 보호된 에이전트와 MCP 도구를 배포하고, 테스트 프롬프트로 응답을 평가해 점수가 낮아지면 풀 리퀘스트 병합을 차단하는 흐름입니다.
내장 평가는 CloudWatch의 OpenTelemetry 추적을 바탕으로 유용성, 정확성, 도구 선택 등을 모델 심사 방식으로 채점합니다. 이 점수는 결정적 정답이 아니므로 규칙 기반 검사와 실제 사용자 시나리오를 함께 운영해야 합니다.
변경된 에이전트가 운영 문을 통과하기 전에 품질 회귀를 찾아 차단하는 과정을 표현했습니다.
L2Ksoft 관점에이전트 CI에는 성공률만 두지 말고 금지 도구 호출, 근거 누락, 과도한 비용과 응답 지연을 별도 차단 조건으로 두어야 합니다. 평가 프롬프트와 기준값도 코드처럼 버전 관리하고, 모델 심사 결과 중 경계 사례는 사람이 정기적으로 재검토해야 합니다.
AWS는 9월 8일 SageMaker AI에서 Qwen3-Coder-30B와 NVIDIA Nemotron-3-Nano-30B를 G5·G6·G6e·G7 인스턴스에 배치한 추론 벤치마크 방법을 공개했습니다. 동일한 입력·출력 길이와 동시성으로 처리량, 지연과 비용을 비교하고 추천 기능으로 후보 구성을 평가합니다.
공식 결과에서는 시험한 워크로드에서 G7이 가장 좋은 성능을 보였지만, 제공 리전과 GPU 메모리, 양자화 형식, 서빙 스택이 결과에 영향을 줍니다. 따라서 해당 결과를 모든 모델과 업무에 일반화해서는 안 됩니다.
같은 입력과 부하 조건에서 세대별 추론 장비의 처리 효율을 비교하는 방식을 표현했습니다.
L2Ksoft 관점인스턴스 선정은 공급사 평균값보다 실제 프롬프트 길이, 동시 사용자 수와 응답 목표를 재현한 부하 시험으로 결정해야 합니다. 모델·양자화·서빙 엔진을 한 번에 바꾸지 말고 변수를 분리해 측정하며, 리전별 가용성과 장애 시 대체 용량도 비용에 포함해야 합니다.
AWS는 9월 8일 관리형 MLflow와 SageMaker AI Model Registry를 여러 계정에 연결하는 두 가지 거버넌스 구성을 공개했습니다. 하나는 공유 거버넌스 허브를 사용하는 허브-스포크 방식이고, 다른 하나는 개발 계정을 허브에서 분리하는 규제 환경용 하이브리드 방식입니다.
승인된 모델을 CI/CD로 운영 엔드포인트까지 이동하는 흐름도 제시하지만, 계정 수와 역할 분리는 조직의 규제·감사 요구에 따라 달라집니다. 참조 구조를 적용하기 전 데이터 이동 경로와 쓰기 권한을 별도로 검증해야 합니다.
개발과 운영 환경을 분리하고 승인된 모델만 통제된 경로로 이동시키는 구조를 표현했습니다.
L2Ksoft 관점모델 승인은 아티팩트 해시, 학습 데이터 계보, 평가 결과와 책임자의 결재를 하나의 배포 기록으로 묶어야 합니다. 개발 계정이 운영 레지스트리에 직접 쓰지 못하게 하고, 승격 과정에서 서명 검증과 최소 권한을 적용해야 합니다.