Thank you for sending your enquiry! One of our team members will contact you shortly.
Thank you for sending your booking! One of our team members will contact you shortly.
Course Outline
Foundations of Multimodal LLMs in Vertex AI
- Exploring the scope of multimodal features in Vertex AI
- Review of Gemini models and compatible data modalities
- Applications in enterprise environments and research settings
Establishing the Development Environment
- Configuring Vertex AI specifically for multimodal operations
- Managing datasets across various data types
- Practical exercise: Setting up the environment and preparing datasets
Long Context Windows and Sophisticated Reasoning
- Comprehending the mechanics of long-context workflows
- Applying these concepts to planning and decision-making processes
- Practical exercise: Executing long-context analysis
Architecting Cross-Modal Workflows
- Synthesizing text, audio, and image analytical capabilities
- Orchestrating sequential multimodal steps within pipelines
- Practical exercise: Constructing a comprehensive multimodal pipeline
Managing Gemini API Parameters
- Setting up configurations for multimodal input and output streams
- Enhancing inference speed and operational efficiency
- Practical exercise: Fine-tuning Gemini API settings
Advanced Implementations and System Integrations
- Developing interactive multimodal agents and digital assistants
- Connecting external APIs and third-party tools
- Practical exercise: Building a functional multimodal application
Assessment and Continuous Improvement
- Conducting performance tests on multimodal models
- Applying metrics for accuracy, alignment, and drift detection
- Practical exercise: Evaluating the efficacy of multimodal workflows
Recap and Future Directions
Requirements
- Strong proficiency in Python programming
- Practical experience in machine learning model development
- Working knowledge of multimodal data types (text, audio, images)
Target Audience
- AI Researchers
- Senior Developers
- ML Scientists
14 Hours