Hy4-preview 780B — Manual de Capacidades
O que ele é
O flagship de código aberto da Tencent: 780 bilhões de parâmetros em arquitetura MoE (Mixture of Experts), quantizado em Q4_K_M para 467 GB. Rodando em 8 GPUs NVIDIA L20N Blackwell (72 GB cada, 576 GB total) em Shenzhen.
Capacidades de excelência
Raciocínio profundo multi-etapa · Geração de código em 30+ linguagens · Análise jurídica multi-parte · Análise financeira e compliance · Escrita criativa e técnica · Tradução multilíngue (PT/EN/ES/ZH) · Síntese documental · Chain-of-thought visível
Como usar
Endpoint: http://hy.beanstech.ai/api/chat
Métricas medidas
25 tok/s (geração) 92 tok/s (prompt) 8 slots paralelos 32k contexto Q4_K_M ~2 min cold start
Arquitetura da frota
z.cloud → Z.ai · GLM-5.3 hy.cloud → Tencent · Hy4-preview g.cloud → Google · gcloud
Para desenvolvedores (usar no ZCode)
Limitações conhecidas
· O raciocínio às vezes consome todos os tokens antes da resposta final
· Contexto de 32k (não 128k como o original)
· Q4_K_M tem ~2-3% menos precisão que o FP16 original
· Latência Brasil→Shenzhen: ~580ms RTT
Monitoramento
health.beanstech.com.br — 37 sondas públicas ao vivo