Agent skill

Ab Test Setup

by ricneves-ai in ricneves-ai/flowgrammers-skills

Quando o usuário quiser planejar, projetar ou implementar um teste A/B ou experimento.

MITAuto-check passedMarketing & SEO

Install Ab Test Setup

skills CLI
$ npx skills add ricneves-ai/flowgrammers-skills --skill ab-test-setup -a claude-code

Project install by default; add -g for ~/.claude/skills/.

GitHub CLI
$ gh skill install ricneves-ai/flowgrammers-skills ab-test-setup --agent claude-code

Project scope by default; add --scope user for a personal install. Needs GitHub CLI 2.90.0 or later (public preview).

Manual copy
$ git clone --depth 1 https://github.com/ricneves-ai/flowgrammers-skills.git skills-src && mkdir -p .claude/skills && cp -r skills-src/marketing-skill/ab-test-setup .claude/skills/ab-test-setup && rm -rf skills-src

Use ~/.claude/skills/ instead of .claude/skills for a personal install. The folder must contain SKILL.md.

Claude Code skills documentation · loads skills from .claude/skills/

Facts

Skill name
ab-test-setup
GitHub stars
115
Token cost
~2.6k tokens
SKILL.md length
1,207 words
Files
1
Skills in repo
10
Repo updated
First seen
Licence
MIT

At a glance

Quando o usuário quiser planejar, projetar ou implementar um teste A/B ou experimento.

  • Works in 4 steps: Comece com uma Hipótese → Teste Uma Coisa → Rigor Estatístico → …
  • Tasks that involve A/B testing
  • SKILL.md covers Avaliação Inicial, Princípios Fundamentais, Framework de Hipótese and Tipos de Teste, plus 7 more sections
  • Instructions only: no scripts, shell commands, URLs or credentials in SKILL.md

What it does

Ab Test Setup is an agent skill from ricneves-ai/flowgrammers-skills. Quando o usuário quiser planejar, projetar ou implementar um teste A/B ou experimento. Use também quando o usuário mencionar "teste A/B", "split test", "experimento", "testar esta mudança", "copy de variante", "teste multivariado", "hipótese", "experimento de conversão", "significância estatística" ou "testar isso". Para implementação de rastreamento, veja analytics-tracking.

Its SKILL.md is about 2.6k tokens, which your agent loads only when the skill is triggered. It is a single SKILL.md file with no bundled scripts.

It sits in Marketing & SEO, covering A/B testing and Product analytics. The repository describes itself as: Flowgrammers Skills - Enteprise Skills. The licence is MIT.

When your agent uses it

  • Tasks that involve A/B testing
  • Tasks that involve Product analytics

Example prompts

  • “teste A/B”
  • “split test”
  • “experimento”
  • “/ab-test-setup”

Workflow steps

4 steps, taken from the step headings in SKILL.md.

  1. Comece com uma Hipótese
  2. Teste Uma Coisa
  3. Rigor Estatístico
  4. Meça o Que Importa

What it can do on your machine

Read from SKILL.md and the folder at commit 1ae2d4a. It shows what the files ask for, not the result of running them.

  • Tool permissions

    Pre-approves nothing: there is no allowed-tools line, so your agent's usual permission prompts apply.

    From allowed-tools in the SKILL.md frontmatter.

  • Runs code

    No scripts in the folder and no shell commands in SKILL.md.

    From the folder's file list and the shell code blocks in SKILL.md.

  • Network

    Links to these hosts (documentation or services it may open):

    • evanmiller.org
    • optimizely.com

    From URLs in SKILL.md, links to its own repository left out.

  • Credentials

    Names no API keys, tokens, secrets or passwords.

    From names ending in _API_KEY, _TOKEN, _SECRET, _KEY or _PASSWORD in SKILL.md.

Context cost

Ab Test Setup loads about 2.6k tokens when it runs. Until then it costs about 98 tokens; SKILL.md has 1,207 words of instructions outside code blocks.

Always · name and description, kept in context so the agent knows when to use it
~98
When it runs · the whole SKILL.md, loaded when a task matches
~2.6k

Estimates: characters ÷ 4, the usual rule of thumb; real counts depend on the model's tokenizer. Scripts and assets cost tokens only if the agent reads them.

Safety

Auto-check passed

The automated check found no risky patterns in SKILL.md.

Automated static check — not a guarantee. Review scripts before installing. It scans the text of SKILL.md for risky patterns (piping downloads into a shell, reading credential files, hidden Unicode, destructive commands); files beside SKILL.md are not scanned.

SKILL.md

The full file from ricneves-ai/flowgrammers-skills at commit 1ae2d4a, republished under its MIT licence (© ricneves-ai). 1,207 words, ~2,644 tokens.

Download SKILL.mdSave it as .claude/skills/ab-test-setup/SKILL.md (or your agent's skills folder).
name
ab-test-setup
description
Quando o usuário quiser planejar, projetar ou implementar um teste A/B ou experimento. Use também quando o usuário mencionar "teste A/B", "split test", "experimento", "testar esta mudança", "copy de variante", "teste multivariado", "hipótese", "experimento de conversão", "significância estatística" ou "testar isso". Para implementação de rastreamento, veja analytics-tracking.
license
MIT
metadata.version
1.0.0
metadata.author
Ric Neves - Flowgrammers
metadata.category
marketing
metadata.updated
2026-03-06
agents
claude-code

Configuração de Teste A/B

Você é um especialista em experimentação e testes A/B. Seu objetivo é ajudar a projetar testes que produzam resultados estatisticamente válidos e acionáveis.

Avaliação Inicial

Verifique o contexto de marketing de produto primeiro: Se .claude/product-marketing-context.md existir, leia-o antes de fazer perguntas. Use esse contexto e só pergunte sobre informações que não estejam cobertas ou que sejam específicas a esta tarefa.

Antes de projetar um teste, entenda:

  1. Contexto do Teste - O que você está tentando melhorar? Que mudança está considerando?
  2. Estado Atual - Taxa de conversão de baseline? Volume de tráfego atual?
  3. Restrições - Complexidade técnica? Prazo? Ferramentas disponíveis?

Princípios Fundamentais

1. Comece com uma Hipótese
  • Não apenas "vamos ver o que acontece"
  • Previsão específica de resultado
  • Baseada em raciocínio ou dados
2. Teste Uma Coisa
  • Uma variável por teste
  • Caso contrário, você não saberá o que funcionou
3. Rigor Estatístico
  • Determine o tamanho da amostra antecipadamente
  • Não espie os resultados e pare cedo
  • Comprometa-se com a metodologia
4. Meça o Que Importa
  • Métrica primária vinculada ao valor do negócio
  • Métricas secundárias para contexto
  • Métricas de proteção para evitar danos

Framework de Hipótese

Estrutura
Porque [observação/dado],
acreditamos que [mudança]
causará [resultado esperado]
para [audiência].
Saberemos que isso é verdadeiro quando [métricas].
Exemplo

Fraca: "Mudar a cor do botão pode aumentar os cliques."

Forte: "Porque os usuários relatam dificuldade em encontrar o CTA (por mapas de calor e feedback), acreditamos que tornar o botão maior e usar cor contrastante aumentará os cliques no CTA em 15%+ para novos visitantes. Mediremos a taxa de cliques de visualização de página até início do cadastro."


Tipos de Teste

TipoDescriçãoTráfego Necessário
A/BDuas versões, mudança únicaModerado
A/B/nMúltiplos variantesAlto
MVTMúltiplas mudanças em combinaçõesMuito alto
Split URLURLs diferentes para variantesModerado

Tamanho da Amostra

Referência Rápida
BaselineLift 10%Lift 20%Lift 50%
1%150k/variante39k/variante6k/variante
3%47k/variante12k/variante2k/variante
5%27k/variante7k/variante1,2k/variante
10%12k/variante3k/variante550/variante

Calculadoras:

Para tabelas detalhadas de tamanho de amostra e cálculos de duração: Veja references/sample-size-guide.md


Seleção de Métricas

Métrica Primária
  • Métrica única mais importante
  • Diretamente vinculada à hipótese
  • O que você usará para encerrar o teste
Métricas Secundárias
  • Apoiam a interpretação da métrica primária
  • Explicam por que/como a mudança funcionou
Métricas de Proteção
  • Coisas que não devem piorar
  • Encerre o teste se significativamente negativas
Exemplo: Teste de Página de Precificação
  • Primária: Taxa de seleção de plano
  • Secundárias: Tempo na página, distribuição de planos
  • Proteção: Tickets de suporte, taxa de reembolso

Projetando Variantes

O Que Variar
CategoriaExemplos
Títulos/CopyÂngulo da mensagem, proposta de valor, especificidade, tom
Design VisualLayout, cor, imagens, hierarquia
CTATexto do botão, tamanho, posicionamento, quantidade
ConteúdoInformações incluídas, ordem, quantidade, prova social
Melhores Práticas
  • Mudança única e significativa
  • Ousada o suficiente para fazer diferença
  • Fiel à hipótese

Alocação de Tráfego

AbordagemDivisãoQuando Usar
Padrão50/50Padrão para A/B
Conservador90/10, 80/20Limitar risco de variante ruim
GradualComeçar pequeno, aumentarMitigação de riscos técnicos

Considerações:

  • Consistência: Usuários veem o mesmo variante no retorno
  • Exposição balanceada ao longo do dia/semana

Implementação

Client-Side
  • JavaScript modifica a página após carregamento
  • Rápido de implementar, pode causar flicker
  • Ferramentas: PostHog, Optimizely, VWO
Server-Side
  • Variante determinada antes da renderização
  • Sem flicker, requer trabalho de desenvolvimento
  • Ferramentas: PostHog, LaunchDarkly, Split

Executando o Teste

Lista de Verificação Pré-Lançamento
  • Hipótese documentada
  • Métrica primária definida
  • Tamanho da amostra calculado
  • Variantes implementados corretamente
  • Rastreamento verificado
  • QA concluído em todos os variantes
Durante o Teste

FAÇA:

  • Monitore problemas técnicos
  • Verifique qualidade do segmento
  • Documente fatores externos

NÃO FAÇA:

  • Espie os resultados e pare cedo
  • Faça mudanças nos variantes
  • Adicione tráfego de novas fontes
O Problema do "Espiar"

Olhar os resultados antes de atingir o tamanho da amostra e parar cedo leva a falsos positivos e decisões erradas. Comprometa-se antecipadamente com o tamanho da amostra e confie no processo.


Analisando Resultados

Significância Estatística
  • 95% de confiança = valor p < 0,05
  • Significa <5% de chance de o resultado ser aleatório
  • Não é uma garantia — apenas um limiar
Lista de Verificação de Análise
  1. Atingiu o tamanho da amostra? Se não, o resultado é preliminar
  2. Estatisticamente significativo? Verifique intervalos de confiança
  3. Tamanho do efeito é relevante? Compare com MDE, projete impacto
  4. Métricas secundárias consistentes? Apoiam a primária?
  5. Alertas de proteção? Algo piorou?
  6. Diferenças por segmento? Mobile vs. desktop? Novos vs. recorrentes?
Interpretando Resultados
ResultadoConclusão
Vencedor significativoImplementar variante
Perdedor significativoManter controle, aprender por quê
Sem diferença significativaPrecisa mais tráfego ou teste mais ousado
Sinais mistosAprofundar, talvez segmentar

Show full SKILL.md (473 more words)Show less

Documentação

Documente cada teste com:

  • Hipótese
  • Variantes (com capturas de tela)
  • Resultados (amostra, métricas, significância)
  • Decisão e aprendizados

Para templates: Veja references/test-templates.md


Erros Comuns

Design do Teste
  • Testar uma mudança muito pequena (indetectável)
  • Testar muitas coisas (não isola)
  • Sem hipótese clara
Execução
  • Parar cedo
  • Alterar coisas no meio do teste
  • Não verificar a implementação
Análise
  • Ignorar intervalos de confiança
  • Selecionar segmentos a dedo
  • Superinterpretar resultados inconclusivos

Perguntas Específicas da Tarefa

  1. Qual é sua taxa de conversão atual?
  2. Quanto tráfego esta página recebe?
  3. Que mudança está considerando e por quê?
  4. Qual é a menor melhoria que vale detectar?
  5. Que ferramentas você tem para testes?
  6. Já testou esta área antes?

Gatilhos Proativos

Ofereça proativamente o design de teste A/B quando:

  1. Taxa de conversão mencionada — Usuário compartilha uma taxa de conversão e pergunta como melhorá-la; sugira projetar um teste em vez de adivinhar soluções.
  2. Decisão de copy ou design é incerta — Quando dois variantes de título, CTA ou layout estão sendo debatidos, proponha testar em vez de opinar.
  3. Baixo desempenho de campanha — Usuário relata landing page ou email abaixo das expectativas; ofereça um plano de teste estruturado.
  4. Discussão sobre página de precificação — Qualquer menção a mudanças na página de precificação deve acionar uma oferta para projetar um teste de precificação com métricas de proteção.
  5. Revisão pós-lançamento — Após um recurso ou campanha entrar no ar, proponha experimentos de acompanhamento para otimizar o resultado.

Artefatos de Saída

ArtefatoFormatoDescrição
Resumo do ExperimentoDocumento MarkdownHipótese, variantes, métricas, tamanho da amostra, duração, responsável
Entrada da Calculadora de Tamanho de AmostraTabelaTaxa de baseline, MDE, nível de confiança, potência
Lista de Verificação Pré-LançamentoChecklistVerificação de implementação, rastreamento e renderização dos variantes
Relatório de Análise de ResultadosDocumento MarkdownSignificância estatística, tamanho do efeito, detalhamento por segmento, decisão
Backlog de TestesLista priorizadaExperimentos classificados por impacto esperado e viabilidade

Comunicação

Todas as saídas devem atender ao padrão de qualidade: hipótese clara, métricas pré-registradas e decisões documentadas. Evite apresentar resultados inconclusivos como vitórias. Cada teste deve produzir um aprendizado, mesmo se o variante perder. Referencie marketing-context para enquadramento do produto e audiência antes de projetar experimentos.


Skills Relacionadas

  • page-cro — USE quando precisar de ideias sobre o que testar; NÃO quando já tem uma hipótese e precisa apenas do design do teste.
  • analytics-tracking — USE para configurar a infraestrutura de medição antes de executar testes; NÃO como substituto para definir métricas primárias antecipadamente.
  • campaign-analytics — USE após a conclusão dos testes para integrar resultados na atribuição de campanha mais ampla; NÃO durante o teste.
  • pricing-strategy — USE quando os resultados do teste afetam decisões de precificação; NÃO para substituir um teste controlado por raciocínio estratégico puro.
  • marketing-context — USE como base antes de qualquer design de teste para garantir que as hipóteses estejam alinhadas com o ICP e posicionamento; sempre carregue primeiro.

© ricneves-ai, MIT. Rendered from Markdown: HTML in the file is shown as text, images as links, and headings moved down two levels. Raw file

Files

Just SKILL.md in marketing-skill/ab-test-setup of ricneves-ai/flowgrammers-skills.

Open the folder on GitHubat commit 1ae2d4a

Compare with similar skills

Ab Test Setup next to the 5 skills that share the most tags, products or categories with it. Stars are the repository's; “used in” counts other GitHub owners with a copy.

Ab Test Setup compared with similar skills
SkillStarsUsed inTokensAuto-checkLicenceRepo updated
Ab Test Setup this skillricneves-ai/flowgrammers-skills115—~2.6kAutomated safety check: PassMIT
AnalyticsNexus-JPF/note-companion8707 repos~2.2kAutomated safety check: PassMIT
App Analyticsappeeky/aso-skills2.2k—~1.6kAutomated safety check: PassMIT
Suede AnalyticsJasonColapietro/suede-creator-skills127—~2.7kAutomated safety check: PassMIT
A/B Test Analysisphuryn/pm-skills27k—~893Automated safety check: PassMIT
Analytics Trackingfreekmurze/dotfiles1k12 repos~2kAutomated safety check: PassNone

Similar skills

  • Analytics

    Nexus-JPF/note-companion

    When the user wants to set up, improve, or audit analytics tracking and measurement.

    870 GitHub starsUsed in 7 repos~2.2k tokens
    Marketing & SEOAuto-check passed
  • App Analytics

    appeeky/aso-skills

    When the user wants to set up, interpret, or improve their app analytics and tracking.

    2.2k GitHub stars~1.6k tokensUpdated 3 days ago
    Marketing & SEOAuto-check passed
  • Suede Analytics

    JasonColapietro/suede-creator-skills

    Suede-owned measurement discipline for tracking plans, event and conversion instrumentation, UTM and campaign-parameter hygiene, and verification of what actually fires.

    127 GitHub stars~2.7k tokensUpdated today
    Marketing & SEOAuto-check passed
  • A/B Test Analysis

    phuryn/pm-skills

    Validates an experiment's setup, works out lift, p-value and confidence interval from A/B test data, and recommends whether to ship, extend or stop.

    27k GitHub stars~893 tokensUpdated today
    Data & AnalyticsAuto-check passed
  • Analytics Tracking

    freekmurze/dotfiles

    When the user wants to set up, improve, or audit analytics tracking and measurement.

    1k GitHub starsUsed in 12 repos~2k tokens
    Data & AnalyticsAuto-check passed
  • Data And Funnel Analytics

    manojbajaj95/claude-gtm-plugin

    Analytics tracking, interpretation, funnel analysis, product metrics, and ROI measurement.

    105 GitHub stars~2.9k tokensUpdated 22 days ago
    Data & AnalyticsAuto-check passed

More from ricneves-ai/flowgrammers-skills

All 10 skills in this repo
  • Prd Generator

    ricneves-ai/flowgrammers-skills

    Gerador de PRD (Product Requirements Document) em portugues-BR a partir de um Product Brief.

    115 GitHub stars~2k tokensUpdated 14 days ago
    Auto-check passed
  • Sdd Generator

    ricneves-ai/flowgrammers-skills

    Especialista em SDD (Software Design Document) — transforma um PRD completo numa estrutura de specs quebrada por pasta no formato .specs/NNN-nome/, com contextos isolados por feature, arquivo…

    115 GitHub stars~1.1k tokensUpdated 14 days ago
    Auto-check passed
  • Codigo Automacao

    ricneves-ai/flowgrammers-skills

    Skills para desenvolvimento de software, debug, APIs, automações no-code e uso avançado de ferramentas de IA para desenvolvimento.

    115 GitHub stars~2.3k tokensUpdated 14 days ago
    Auto-check: notes
  • Conteudo Copy

    ricneves-ai/flowgrammers-skills

    Skills para criação de conteúdo escrito, copy persuasivo, headlines, emails e artigos em português BR.

    115 GitHub stars~3k tokensUpdated 14 days ago
    Auto-check passed
  • Marketing Vendas

    ricneves-ai/flowgrammers-skills

    Skills para funis de vendas, propostas comerciais, tratamento de objeções e publicidade digital com contexto do mercado brasileiro.

    115 GitHub stars~2.9k tokensUpdated 14 days ago
    Auto-check passed
  • Rotina Organizacao

    ricneves-ai/flowgrammers-skills

    Skills de produtividade pessoal com metodologias GTD, time blocking, gestão de energia e organização de projetos pessoais.

    115 GitHub stars~2.5k tokensUpdated 14 days ago
    Auto-check passed

Categories

Questions about Ab Test Setup

What does Ab Test Setup do?

Quando o usuário quiser planejar, projetar ou implementar um teste A/B ou experimento. Ab Test Setup is an agent skill from ricneves-ai/flowgrammers-skills. Quando o usuário quiser planejar, projetar ou implementar um teste A/B ou experimento.

When should I use Ab Test Setup?

Ab Test Setup fits situations like: tasks that involve A/B testing; tasks that involve Product analytics.

How do I install Ab Test Setup in Claude Code?

Run `npx skills add ricneves-ai/flowgrammers-skills --skill ab-test-setup -a claude-code`. Or copy the skill folder (marketing-skill/ab-test-setup in ricneves-ai/flowgrammers-skills) into .claude/skills/ab-test-setup in your project. Claude Code loads it when a task matches its description.

How do I install Ab Test Setup in Codex?

Run `npx skills add ricneves-ai/flowgrammers-skills --skill ab-test-setup -a codex`. Or copy the skill folder (marketing-skill/ab-test-setup in ricneves-ai/flowgrammers-skills) into .agents/skills/ab-test-setup in your project. Codex loads it when a task matches its description.

Can I use Ab Test Setup in Cursor, Gemini CLI or GitHub Copilot?

Cursor, Gemini CLI, GitHub Copilot and OpenCode also load SKILL.md folders. With the skills CLI, run `npx skills add ricneves-ai/flowgrammers-skills --skill ab-test-setup -a cursor` (or -a gemini-cli, github-copilot or opencode for the others). To copy it by hand, put the folder in .cursor/skills/ab-test-setup, .gemini/skills/ab-test-setup, .github/skills/ab-test-setup and .opencode/skills/ab-test-setup in your project.

What does Ab Test Setup need to run?

SKILL.md names no scripts, command-line tools or credentials: Ab Test Setup is instructions for the agent only.

Does Ab Test Setup access the network?

SKILL.md names 2 domains. As links in the text: evanmiller.org and optimizely.com. This is read from the text; nothing was executed.

Is Ab Test Setup safe to install?

Our automated static check of SKILL.md found no risky patterns, such as piping downloads into a shell, reading credential files or hidden Unicode. It is not a guarantee. Review the folder before installing.

What licence does Ab Test Setup use?

Ab Test Setup is published under the MIT licence (declared in SKILL.md). It allows redistribution, so the full SKILL.md is shown on this page.

How many tokens does Ab Test Setup use?

About 2.6k tokens (SKILL.md is roughly 11k characters). Agents keep only the skill's name and description in context until a task matches; then they load SKILL.md in full.

What are the alternatives to Ab Test Setup?

Skills that share tags, products or a category with Ab Test Setup: Analytics (Nexus-JPF/note-companion, 870 stars), App Analytics (appeeky/aso-skills, 2.2k stars), Suede Analytics (JasonColapietro/suede-creator-skills, 127 stars) and A/B Test Analysis (phuryn/pm-skills, 27k stars). The comparison table on this page puts their stars, adoption, token cost, safety result and licence side by side.

Who maintains Ab Test Setup?

ricneves-ai (a GitHub user) maintains it in ricneves-ai/flowgrammers-skills, which has 115 GitHub stars. The repository holds 10 skills in this directory. The repository was last updated on September 25, 2026.

Source: ricneves-ai/flowgrammers-skills on GitHub. Facts on this page come from the repository at the commit we read; the author's words are quoted as theirs.