Get in Touch

Course Outline

Foundations of Multimodal LLMs in Vertex AI

  • Exploring the scope of multimodal features in Vertex AI
  • Review of Gemini models and compatible data modalities
  • Applications in enterprise environments and research settings

Establishing the Development Environment

  • Configuring Vertex AI specifically for multimodal operations
  • Managing datasets across various data types
  • Practical exercise: Setting up the environment and preparing datasets

Long Context Windows and Sophisticated Reasoning

  • Comprehending the mechanics of long-context workflows
  • Applying these concepts to planning and decision-making processes
  • Practical exercise: Executing long-context analysis

Architecting Cross-Modal Workflows

  • Synthesizing text, audio, and image analytical capabilities
  • Orchestrating sequential multimodal steps within pipelines
  • Practical exercise: Constructing a comprehensive multimodal pipeline

Managing Gemini API Parameters

  • Setting up configurations for multimodal input and output streams
  • Enhancing inference speed and operational efficiency
  • Practical exercise: Fine-tuning Gemini API settings

Advanced Implementations and System Integrations

  • Developing interactive multimodal agents and digital assistants
  • Connecting external APIs and third-party tools
  • Practical exercise: Building a functional multimodal application

Assessment and Continuous Improvement

  • Conducting performance tests on multimodal models
  • Applying metrics for accuracy, alignment, and drift detection
  • Practical exercise: Evaluating the efficacy of multimodal workflows

Recap and Future Directions

Requirements

  • Strong proficiency in Python programming
  • Practical experience in machine learning model development
  • Working knowledge of multimodal data types (text, audio, images)

Target Audience

  • AI Researchers
  • Senior Developers
  • ML Scientists
 14 Hours

Number of participants


Price per participant

Upcoming Courses

Related Categories