Calculadora de Regressão Linear

Linha de melhor ajuste
Resultados

A regressão linear ajusta a única linha reta y = mx + b que minimiza a soma dos erros verticais quadrados dos dados. É a primeira ferramenta a ser utilizada quando você suspeita que uma variável influencia outra, gastos com publicidade vs. inscrições, temperatura vs. vendas de sorvete, altura vs. tamanho do sapato. Cole pares (x, y) e a calculadora retorna inclinação, intercepto, R-quadrado e o coeficiente de correlação de Pearson.

Como ajustar uma linha de regressão

  1. 1

    Cole os dados

    Um par por linha: x e y separados por vírgula, tabulação ou espaço. Os cabeçalhos são ignorados.

  2. 2

    Leia a inclinação e o intercepto

    Inclinação m = mudança em y por mudança de 1 unidade em x. Intercepto b = y quando x = 0.

  3. 3

    Verifique o R²

    R² ∈ [0, 1], a parte da variância em y explicada por x. 0.7+ é geralmente forte em dados sociais.

  4. 4

    Preveja novos valores

    Substitua qualquer x em y = m·x + b para obter a previsão do modelo.

As fórmulas por trás do ajuste

Dado N pontos de dados (x_i, y_i), a inclinação e o intercepto de mínimos quadrados ordinários são:

m = Σ((x_i − x̄)(y_i − ȳ)) / Σ((x_i − x̄)²)
b = ȳ − m · x̄

R², o coeficiente de determinação, é a parte da variância em y explicada por x:

R² = 1 − SS_res / SS_tot

onde SS_res é a soma dos resíduos quadrados e SS_tot é a soma das desvios quadrados de y em relação à sua média. Pearson r é ±√R², carregando o sinal da inclinação.

Exemplo prático

Cinco pontos de dados:

x y
1 2
2 4
3 5
4 4
5 6

x̄ = 3, ȳ = 4.2. Numerador da covariância = (1-3)(2-4.2) + (2-3)(4-4.2) + (3-3)(5-4.2) + (4-3)(4-4.2) + (5-3)(6-4.2) = 4.4 + 0.2 + 0 − 0.2 + 3.6 = 8.0. Numerador da variância de x = 4 + 1 + 0 + 1 + 4 = 10.

  • Inclinação m = 8.0 / 10 = 0.8
  • Intercepto b = 4.2 − 0.8 × 3 = 1.8
  • Equação: y = 0.8x + 1.8
  • R² ≈ 0.727

O que os números dizem (e não dizem)

  • Inclinação m responde “quanto y se move por unidade de x”. Tem as unidades de y/x.
  • Intercepto b responde “qual é y quando x é 0”. Somente significativo se x = 0 for plausível para seus dados.
  • mede a qualidade do ajuste, não a causalidade. Um R² alto em dados proxy sem ruído ainda pode ser sem significado.
  • Pearson r captura a associação linear. r próximo de 0 com uma forte relação curva ainda significa “sem ajuste linear”, não “sem relação”.

Armadilhas

  • Outliers distorcem fortemente os ajustes de OLS porque a perda é quadrada. Um ponto fora da curva pode rotacionar a linha em 20 graus.
  • Não-linearidade não é detectada apenas pelo R², sempre plote os resíduos em relação a x.
  • A regressão não é simétrica: ajustar y em x dá uma linha diferente de ajustar x em y.
  • Extrapolação além do intervalo dos seus dados é especulação. O ajuste só conhece o intervalo que viu.

Perguntas frequentes

40% da variação em y é explicada pela relação linear com x. Os 60% restantes vêm de ruído, outras variáveis ou não-linearidade. Em física isso é ruim; em dados sociais ou econômicos é frequentemente aceitável.

Comece com linear. Se o gráfico de resíduos mostrar uma curva clara, tente uma transformação quadrática ou logarítmica. Ir direto para um polinômio de alto grau ajusta demais e generaliza mal para novos dados.

Matematicamente você precisa de 2; significativamente, pelo menos 20. Abaixo disso, um outlier domina o ajuste. Para resultados publicados, verifique as orientações de tamanho de amostra específicas para sua área.

Não. Os pares (x, y) que você cola são ajustados em seu navegador e nunca saem da página.

Ferramentas relacionadas

Ferramenta disponível em outros idiomas