전체 글 (3) 썸네일형 리스트형 [AI] Back-propagation 구현 PyTorch를 이용한 forward propagation, backward propagation의 과정과 PyTorch autograd의 여러가지 기능을 간단하게 구현한다.실제 PyTorch source code는 매우 방대하고 복잡하기 때문에, 그 중에서 핵심적인 기능만을 고려한 toy library MyTorch의 MyTensor (텐서)를 구현한다.PyTorch와 Numpy는 거의 동일하지만 PyTorch는 Backward를 할 수 있도록 만들어졌다는 차이점이 있다.기존 딥러닝 프레임워크를 사용하지 않고 Linear regression 모델을 구현해서 Back-propagation까지 한다. Linear regression 모델은 원래 Back-propagation을 하지 않고 수식적으로 풀어서 .. [AI] Transformer 아키텍처 그림 한 눈에 보기 Transformer 모델의 아키텍처 그림이 논문에서는 공간상의 문제로 어느정도 축약이 되어 있는데, 이로 인해 약간 햇갈리는 부분이 생긴다는 느낌을 받았다.그럼으로 한 눈에 보기 쉽도록 최대한 자세하게 Transformer를 그림으로 표현했다. 비교할 수 있도로고 Transformer 논문 링크도 함께 달아두겠다.https://arxiv.org/pdf/1706.03762 Activation function 시각화 Activation function은 딥러닝 모델의 비선형성을 만드는 중요한 함수다. Activation function의 종류로 Sigmoid, Tanh, ReLU, Leaky ReLU, PReLU, ELU, GELU, SiLU, Mish 등 다양하게 존재한다. 그런데 gradient vanishing 문제나 예측할 때 걸리는 시간 등의 요인으로 어떤 Activation function을 사용해야 하는지에 대한 갈등이 생기곤 한다. ReLU가 빠르지만 gradient vanishing 문제가 있고, Sigmoid는 성능이 안좋다는 등의 이야기가 많지만 모델을 학습하고 추론했을 때 어떤 식으로 함수(모델)가 작동하는지에 대해 직접 시각화해서 보는 사람은 적은 것 같다. 현재 글은 Sin 함수를 간단한 .. 이전 1 다음